← Все посты

Посты с тегом #SWE-bench Pro

постов: 2

  • AI Benchmarks

    Claude Opus 5.5 занял первое место в SWE-bench Pro с 89,9%

    BenchLM обновил таблицу SWE-bench Pro: Claude Opus 5.5 вышел на первое место с 89,9%, заметно опередив Claude Fable 5.1 и Claude Mythos 5. Это сильный результат для задач по реальным репозиториям, но его нужно читать с оговоркой: многие строки в таблице основаны на отчётах самих поставщиков.

  • AI Benchmarks

    MAI-Code-1-Flash заметно обошла Haiku на SWE-bench Pro

    В обсуждении релиза MAI-Code-1-Flash на Hacker News всплыл важный ориентир для рынка кодовых моделей: в одном и том же контуре на базе VS Code новая модель показала 51,2% на SWE-bench Pro против 35,2% у Haiku. Даже с обычными оговорками к настройке тестов это достаточно большой разрыв, чтобы считать его заметным сдвигом в гонке инженерных ИИ-моделей.