В сообществе Hugging Face заметили бесплатную анонимную модель Pixel Canary: на проверке агентных задач Next.js она набрала 90,3% и закрыла 28 из 31 задания, сравнявшись с GPT-6 Astra в той же таблице.
У Claude Opus 4.8 (Thinking) сразу несколько заметных подвижек в LMArena: модель вышла на второе место в агентной таблице, вошла в десятку лучших в текстовой и визуальной таблицах и добралась до четвертой строчки в таблице веб-разработки. На фоне этого позиции GPT 5.5 и qwen3.7-max в ряде срезов просели.
На таблице SWE-bench Verified произошло заметное уплотнение сразу за лидерами: GPT-5-2 Codex вошла в кластер с результатом 72,8% рядом с GLM-5 и GPT-5-2 в режиме повышенного рассуждения. Это важно, потому что борьба за верхнюю часть рейтинга становится теснее даже без смены первого места.
В свежем срезе SWE-bench Verified лидерство удерживает Claude 4.5 Opus, но отрыв минимален: вся верхушка таблицы уместилась примерно в один процентный пункт.