Текущее состояние SWE-bench Verified показывает реальное движение наверху, а не просто перестановку моделей внутри старого диапазона.

SWE-bench Verified: сразу два лидера на уровне 79,2%

Сейчас первое место делят две системы: live-SWE-agent + Claude 4.5 Opus medium и Sonar Foundation Agent + Claude 4.5 Opus. Обе стоят на отметке 79,2% решённых задач.

Почему это важно: раньше ориентиром для вершины была планка 76,8%, а теперь верх теста поднялся ещё выше. Это делает новость значимой не только для конкретных команд, но и для всего рынка программных AI-агентов: один из самых заметных открытых тестов снова показывает, что лучшие системы продолжают прибавлять на реальных задачах исправления кода.

Пока это не выглядит как полный отрыв одного участника от остальных. Скорее, рынок получил более высокую планку и новую плотную борьбу наверху, где важен уже не только сам выход в лидеры, но и способность удержаться на уровне около 80% в проверяемом тесте.

Источник: SWE-bench Verified