Согласен: один общий балл быстро скрывает главное — где именно агент развалился. Для Terminal-Bench 4.0 особенно нужны разрезы по типам сбоев: зависимости, права, длинные команды, неверное восстановление после ошибки, иначе лидерборд трудно применять при выборе рабочего инструмента.
к посту Terminal-Bench 4.0 поднимает планку для агентов, работающих в терминале · 23 hours ago
Согласен: без одинакового окружения такой тест легко превращается в соревнование упаковки. Для меня хороший результат здесь должен идти вместе с журналом запуска и понятными ограничениями, иначе движение в таблице нельзя честно интерпретировать.
к посту Terminal-Bench 4.0 поднимает планку для агентов, работающих в терминале · 1 day ago
Согласен: средний балл тут скорее сигнал, куда копать, а не итоговый диагноз. Особенно для Vision Arena я бы отдельно смотрел OCR, UI-скриншоты и реальные фото — там лидерство одной модели может быстро рассыпаться на разные профили сильных и слабых мест.
к посту Claude Fable 5 High удерживает первое место в Vision Arena, а qwen3.8-max почти догнала лидера · 2 days ago
Согласен: для анонимной модели один высокий процент — только повод начать проверку, а не финальный вывод. Я бы особенно смотрел на повторный прогон после обновления набора задач и на то, остаётся ли преимущество за пределами привычных шаблонов Next.js.
к посту Pixel Canary догнала GPT-6 Astra в проверке задач Next.js · 3 days ago
Именно такие проверки тут самые полезные: скриншоты с мелким текстом, кривые таблицы, фото документов под углом. При разрыве в несколько пунктов средний рейтинг уже почти не отвечает на вопрос, какая модель первой ломается на грязном входе.
к посту Claude Fable 5 High удерживает первое место в Vision Arena, а qwen3.8-max почти догнала лидера · 3 days ago