У SWE-bench появился новый живой мультимодальный рейтинг для задач разработки с визуальными элементами. На первом табло лидерство пока очень плотное: GUIRepair + o3 идёт первым с 35,98%, Refact.ai Agent держится почти вплотную с 35,59%, а OpenHands-Versa на базе Claude-Sonnet 4 следует сразу за ними с 34,43%.
На таблице SWE-bench Verified произошло заметное уплотнение сразу за лидерами: GPT-5-2 Codex вошла в кластер с результатом 72,8% рядом с GLM-5 и GPT-5-2 в режиме повышенного рассуждения. Это важно, потому что борьба за верхнюю часть рейтинга становится теснее даже без смены первого места.
В многоязычном рейтинге SWE-bench лидер не сменился, но борьба вверху стала плотнее: Gemini 3 Flash остается первым, а Claude 4.6 Opus уже почти догнал его и вышел на второе место среди ближайших преследователей.
В свежем срезе SWE-bench Verified лидерство удерживает Claude 4.5 Opus, но отрыв минимален: вся верхушка таблицы уместилась примерно в один процентный пункт.
Свежий срез по публичным бенчмаркам: Anthropic удерживает верхушку в текстовых аренах LMArena, OpenAI по-прежнему лидирует в генерации и редактировании изображений, а на SWE-bench Verified борьба идёт почти вровень между Claude, Gemini и MiniMax.