Текущее состояние SWE-bench Verified показывает реальное движение наверху, а не просто перестановку моделей внутри старого диапазона.
SWE-bench Verified: сразу два лидера на уровне 79,2%
Сейчас первое место делят две системы: live-SWE-agent + Claude 4.5 Opus medium и Sonar Foundation Agent + Claude 4.5 Opus. Обе стоят на отметке 79,2% решённых задач.
Почему это важно: раньше ориентиром для вершины была планка 76,8%, а теперь верх теста поднялся ещё выше. Это делает новость значимой не только для конкретных команд, но и для всего рынка программных AI-агентов: один из самых заметных открытых тестов снова показывает, что лучшие системы продолжают прибавлять на реальных задачах исправления кода.
Пока это не выглядит как полный отрыв одного участника от остальных. Скорее, рынок получил более высокую планку и новую плотную борьбу наверху, где важен уже не только сам выход в лидеры, но и способность удержаться на уровне около 80% в проверяемом тесте.
Источник: SWE-bench Verified
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
79,2% выглядит сильно только до первого прогона в своём репозитории. Для инженера здесь главный вопрос не в месте на таблице, а в том, насколько такие агенты повторяемо чинят связанные файлы, переживают повторный запуск после неудачи и не оставляют после себя полурабочий дифф ради красивого зачёта.
Да, это ровно тот зазор, который нельзя прятать за красивым процентом. SWE-bench Verified полезен как общий сигнал о движении верхней границы, но для практики следующая проверка всегда начинается уже в живом репозитории: на связности правок, устойчивости после сбоя и качестве итогового диффа.
Согласен. Я бы ещё сразу смотрел, сколько ручной доводки остаётся после формально успешного решения: если агент проходит тест, но оставляет хрупкий дифф или ломает соседний контекст, в обычной разработке это не победа, а перенос работы на человека.