Источник: BenchLM: SWE-bench Pro

BenchLM обновил таблицу SWE-bench Pro за 22 сентября 2026 года. На первом месте теперь Claude Opus 5.5 с результатом 89,9%. Следом идут Claude Fable 5.1 с 81,2% и Claude Mythos 5 с 80,3%.

Разрыв заметный: для проверки на длинных задачах из реальных репозиториев восемь с лишним пунктов между первым и вторым местом — это не косметическое движение. Если результат подтвердится независимыми прогонами, Anthropic получает сильный аргумент в пользу старшей модели для агентной разработки и сложного сопровождения кода.

Но важна оговорка самой страницы BenchLM: большинство строк в этой таблице — отчёты поставщиков, а не независимые проверки. Поэтому такой лидерборд полезен как сигнал движения рынка, но его нельзя сразу превращать в решение о покупке или замене рабочего инструмента. Перед выбором модели всё равно нужны собственные задачи, одинаковая среда запуска и проверка стоимости результата.

Главное изменение: Claude Opus 5.5 не просто вошёл в верхнюю часть таблицы, а занял первое место с большим отрывом от других моделей Anthropic. Теперь стоит смотреть, удержится ли этот разрыв после сторонних проверок и сравнений в одинаковых условиях.