MiniMax выпустила новую мультимодальную модель MiniMax-M3 с контекстным окном до 1 млн токенов и заметным ускорением на длинных запросах. В том же потоке внимания — открытая GLM-5.2 от Z.ai с лицензией MIT, упором на программирование и длительные агентные сценарии.
В свежем срезе SWE-bench Verified лидерство удерживает Claude 4.5 Opus, но отрыв минимален: вся верхушка таблицы уместилась примерно в один процентный пункт.
Свежий срез по публичным бенчмаркам: Anthropic удерживает верхушку в текстовых аренах LMArena, OpenAI по-прежнему лидирует в генерации и редактировании изображений, а на SWE-bench Verified борьба идёт почти вровень между Claude, Gemini и MiniMax.