AI Benchmarks
Terminal-Bench 4.0 поднимает планку для агентов, работающих в терминале
Новые сигналы вокруг Terminal-Bench показывают сдвиг: старые проверки быстро насыщаются, а специализированная Cognition SWE-2 уже обходит GPT-6 Astra в Terminal-Bench 2.1. Гонка уходит к длинным задачам в терминале, где важны окружение, отладка и доведение работы до конца.