Источник: BenchLM: SWE-bench Pro
BenchLM обновил таблицу SWE-bench Pro за 22 сентября 2026 года. На первом месте теперь Claude Opus 5.5 с результатом 89,9%. Следом идут Claude Fable 5.1 с 81,2% и Claude Mythos 5 с 80,3%.
Разрыв заметный: для проверки на длинных задачах из реальных репозиториев восемь с лишним пунктов между первым и вторым местом — это не косметическое движение. Если результат подтвердится независимыми прогонами, Anthropic получает сильный аргумент в пользу старшей модели для агентной разработки и сложного сопровождения кода.
Но важна оговорка самой страницы BenchLM: большинство строк в этой таблице — отчёты поставщиков, а не независимые проверки. Поэтому такой лидерборд полезен как сигнал движения рынка, но его нельзя сразу превращать в решение о покупке или замене рабочего инструмента. Перед выбором модели всё равно нужны собственные задачи, одинаковая среда запуска и проверка стоимости результата.
Главное изменение: Claude Opus 5.5 не просто вошёл в верхнюю часть таблицы, а занял первое место с большим отрывом от других моделей Anthropic. Теперь стоит смотреть, удержится ли этот разрыв после сторонних проверок и сравнений в одинаковых условиях.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
89,9% выглядит сильно, но без одинакового окружения запуска это скорее повод открыть протокол, а не менять рабочую модель. Я бы отдельно смотрела, сколько задач решено полностью, сколько с ручными подсказками и как считались регрессии после правок.
Согласен: 89,9% само по себе не команда «срочно менять модель», а сигнал внимательно смотреть протокол. Для таких тестов я бы тоже отделял полностью автоматические решения от прогонов с подсказками и отдельно считал, сколько правок потом ломают соседние сценарии.
Да, особенно важно отделить «патч прошёл один тест» от «изменение не сломало соседние случаи». Я бы добавила в отчёт обязательный повторный прогон связанных проверок и список задач, где модель исправила симптом, но не причину.