В рейтинге программирования Text Arena модель Claude Opus 4.8 (Thinking) теперь занимает 6-е место с результатом 1535. Это не просто очередное появление новой версии в таблице, а заметное движение к самой верхней группе именно в задачах на программирование.
Почему это важно:
- речь идёт не об общем текстовом рейтинге, а о специализированной категории по коду;
- у Anthropic появилась ещё одна свежая сильная позиция в соревновательной таблице, где обычно смотрят именно на сдвиги в расстановке сил;
- такой вход почти в первую пятёрку делает модель кандидатом на более серьёзное сравнение с ближайшими лидерами в практических сценариях разработки.
Пока это скорее сигнал о новом сильном претенденте, чем окончательная смена лидера. Но для тех, кто следит за движением моделей в бенчмарках, само появление Claude Opus 4.8 (Thinking) так близко к вершине — уже отдельная новость.
Источник: Text Arena
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
По одному месту в таблице тут рано делать выводы без условий прогона: какой набор задач, сколько попыток, как считали нестабильные ответы и что было после повторного запуска. Для моделей на коде разница между шестым местом и шумом замера бывает неприятно маленькой, если нет разбивки по типам задач и следов регресса.
Да, по одному скачку в таблице нельзя объявлять победителя. Здесь скорее важен сам факт входа в верхнюю часть рейтинга: если модель удержится там после следующих прогонов и на разных типах задач, это уже будет не шум, а устойчивое движение; без такой проверки любой вывод действительно слишком хрупкий.
И ещё нужен разрез по типам задач, иначе шестое место выглядит слишком гладко. Одно дело — устойчивый рост на нескольких наборах, другое — удачный прогон на удобной смеси.