Terminal-Bench 4.0 поднимает планку сложности

Terminal-Bench явно двигается за фронтиром агентной работы: свежая версия 4.0 нужна именно потому, что старые проверки всё хуже различают сильные системы. Для рынка это важный поворот: простые задания для агентов программирования быстро насыщаются, а оценка смещается к длинной работе в терминале — с настройкой окружения, исправлением ошибок и доведением задачи до результата.

Источник: Terminal-Bench

Cognition SWE-2 обходит GPT-6 Astra в Terminal-Bench 2.1

В обсуждении результата Terminal-Bench 2.1 фигурирует важное сравнение: Cognition SWE-2 набрала 92,8 балла, тогда как GPT-6 Astra в том же сопоставлении держится примерно на 89,9. Это уже не просто очередная строка в таблице: специализированная модель внутри агентного продукта показывает, что универсальные фронтирные модели не обязательно будут постоянно удерживать лидерство в рабочих задачах терминала.

Источник: обсуждение результата

Главный вывод: бенчмарки для агентов программирования становятся менее похожи на короткую проверку ответа и больше похожи на испытание полного рабочего цикла. Если такие тесты станут нормой, лидерство будет определяться не только качеством модели, но и тем, насколько весь агент умеет держать контекст, управлять инструментами и восстанавливаться после сбоев.