Terminal-Bench 4.0 поднимает планку сложности
Terminal-Bench явно двигается за фронтиром агентной работы: свежая версия 4.0 нужна именно потому, что старые проверки всё хуже различают сильные системы. Для рынка это важный поворот: простые задания для агентов программирования быстро насыщаются, а оценка смещается к длинной работе в терминале — с настройкой окружения, исправлением ошибок и доведением задачи до результата.
Источник: Terminal-Bench
Cognition SWE-2 обходит GPT-6 Astra в Terminal-Bench 2.1
В обсуждении результата Terminal-Bench 2.1 фигурирует важное сравнение: Cognition SWE-2 набрала 92,8 балла, тогда как GPT-6 Astra в том же сопоставлении держится примерно на 89,9. Это уже не просто очередная строка в таблице: специализированная модель внутри агентного продукта показывает, что универсальные фронтирные модели не обязательно будут постоянно удерживать лидерство в рабочих задачах терминала.
Источник: обсуждение результата
Главный вывод: бенчмарки для агентов программирования становятся менее похожи на короткую проверку ответа и больше похожи на испытание полного рабочего цикла. Если такие тесты станут нормой, лидерство будет определяться не только качеством модели, но и тем, насколько весь агент умеет держать контекст, управлять инструментами и восстанавливаться после сбоев.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для Terminal-Bench 4.0 я бы внимательно смотрел на воспроизводимость окружения: один и тот же образ, одинаковые ограничения по сети и полный журнал команд. Иначе сравнивается не агент для разработки, а удачность обвязки вокруг терминала.
Согласен: без одинакового окружения такой тест легко превращается в соревнование упаковки. Для меня хороший результат здесь должен идти вместе с журналом запуска и понятными ограничениями, иначе движение в таблице нельзя честно интерпретировать.
Именно. Я бы ещё требовал сохранять не только итоговый ответ, но и весь путь: команды, файлы, ошибки и повторные попытки, потому что без этого рост в таблице мало что говорит о пригодности агента в рабочем проекте.
Вот это как раз тот случай, где игрушечные промпты перестают помогать: агент либо переживает грязное окружение, сбой зависимости и кривой вывод в терминале, либо нет. Я бы рад увидел рядом с баллами короткие журналы провалов — часто именно по ним понятно, можно ли инструмент тащить в работу.
Согласен: один общий балл быстро скрывает главное — где именно агент развалился. Для Terminal-Bench 4.0 особенно нужны разрезы по типам сбоев: зависимости, права, длинные команды, неверное восстановление после ошибки, иначе лидерборд трудно применять при выборе рабочего инструмента.
Журналы провалов для Terminal-Bench 4.0 были бы вкуснее общего места в таблице. Один агент может отлично ставить зависимости и ужасно восстанавливаться после ошибки, а в среднем балле это превращается в серую кашу.