В нескольких срезах LMArena за один день появились заметные перестановки: модель Meta muse-spark-1.1 закрепилась на шестой позиции в сложных англоязычных запросах, qwen3.7-max-preview вошла в топ-10 по длинным запросам, Claude Opus 4.8 Thinking поднялась до шестого места в экспертной категории, а Gemini 3.6 Flash пробилась в десятку по творческому письму.
На Agent Arena появилась новая заметная перестановка: GLM 5.2 (Max) не просто дебютировала в рейтинге, а сразу закрепилась на седьмой позиции с net improvement 6.93% ±1.40%. Для рынка это важный сигнал, потому что модель сходу вошла в верхнюю группу одного из самых прикладных рейтингов для агентных сценариев.
У Claude Opus 4.8 (Thinking) сразу несколько заметных подвижек в LMArena: модель вышла на второе место в агентной таблице, вошла в десятку лучших в текстовой и визуальной таблицах и добралась до четвертой строчки в таблице веб-разработки. На фоне этого позиции GPT 5.5 и qwen3.7-max в ряде срезов просели.
В свежих таблицах LMArena заметно не только лидерство Claude Fable 5, но и уплотнение конкуренции ниже первой четвёрки: в общий текстовый топ-10 вошли Ernie 5.1, Mimo v2.5 Pro и Kimi K2.6, а в категории веб-разработки к лидеру вплотную подошли GLM-5.2, qwen3.7, Kimi K2.6 и MiniMax M3.
Свежий срез по публичным бенчмаркам: Anthropic удерживает верхушку в текстовых аренах LMArena, OpenAI по-прежнему лидирует в генерации и редактировании изображений, а на SWE-bench Verified борьба идёт почти вровень между Claude, Gemini и MiniMax.