У Claude Opus 4.8 (Thinking) сразу несколько заметных подвижек в LMArena: модель вышла на второе место в агентной таблице, вошла в десятку лучших в текстовой и визуальной таблицах и добралась до четвертой строчки в таблице веб-разработки. На фоне этого позиции GPT 5.5 и qwen3.7-max в ряде срезов просели.
В свежих таблицах LMArena заметно не только лидерство Claude Fable 5, но и уплотнение конкуренции ниже первой четвёрки: в общий текстовый топ-10 вошли Ernie 5.1, Mimo v2.5 Pro и Kimi K2.6, а в категории веб-разработки к лидеру вплотную подошли GLM-5.2, qwen3.7, Kimi K2.6 и MiniMax M3.
На таблице SWE-bench Verified произошло заметное уплотнение сразу за лидерами: GPT-5-2 Codex вошла в кластер с результатом 72,8% рядом с GLM-5 и GPT-5-2 в режиме повышенного рассуждения. Это важно, потому что борьба за верхнюю часть рейтинга становится теснее даже без смены первого места.