Claude Fable 5 вышла в единоличные лидеры OCR-рейтинга Vision Arena
В OCR-срезе Vision Arena появился более явный лидер: Claude Fable 5 поднялась на первое место с 1327 очками и оторвалась от Claude Opus 4.7 Thinking, которая идёт следом с 1320.
В OCR-срезе Vision Arena появился более явный лидер: Claude Fable 5 поднялась на первое место с 1327 очками и оторвалась от Claude Opus 4.7 Thinking, которая идёт следом с 1320.
На YouTube вышел разбор, в котором GPT-5.6 показывают сильнее Claude Mythos в тестах, связанных с программированием. Для рубрики про бенчмарки здесь важен сам сдвиг: авторы подают историю как смену лидерства в практической категории, а не как обычную новость о выпуске модели.
В свежих срезах Text Arena произошли два заметных движения: qwen3.7-max-preview поднялась в десятку лучших в отраслевом рейтинге для ИТ-сервисов, а GPT-5.2 Chat вошла в топ-10 таблицы для многоходовых диалогов. Верхние строчки по-прежнему удерживает Anthropic, но давление со стороны Qwen и OpenAI усиливается.
Новая модель wan2.7-i2v уже поднялась на 5-е место в рейтинге Arena по генерации видео из изображения. Для свежего участника это заметный вход: 1434 балла и 14 113 голосов сразу выводят модель в верхнюю часть таблицы.
В свежих бенчмарках и таблицах лидеров за день заметны сразу несколько сдвигов: Claude Sonnet 4.5 стартовала первой в новом CodeClash, Dreamina Seedance 2.0 лидирует в редактировании видео, в преобразовании изображения в видео наверху почти ничья между Gemini Omni Flash и Dreamina, а в редактировании изображений заметный отрыв показала gpt-image-2.
В срезе веб-разработки на Code Arena модель GLM 5.2 (Max) сразу поднялась на вторую строчку с рейтингом 1595 и теперь уступает только Claude Fable 5. Это заметное движение для рынка бенчмарков: верхняя часть такого рейтинга меняется нечасто, а новый релиз почти сразу оказался в прямой борьбе за лидерство.
У SWE-bench появился новый живой мультимодальный рейтинг для задач разработки с визуальными элементами. На первом табло лидерство пока очень плотное: GUIRepair + o3 идёт первым с 35,98%, Refact.ai Agent держится почти вплотную с 35,59%, а OpenHands-Versa на базе Claude-Sonnet 4 следует сразу за ними с 34,43%.
В свежем срезе Agent Arena заметно сразу несколько движений: Anthropic держит вершину текстовых и визуальных таблиц, Meta с muse-spark уже вклинилась в верхнюю группу, а сама площадка открыто объяснила, что теперь меряет не одиночный ответ модели, а поведение агента в более живом рабочем контуре. Ниже — четыре изменения, которые действительно меняют чтение текущих лидербордов.
В обсуждении релиза MAI-Code-1-Flash на Hacker News всплыл важный ориентир для рынка кодовых моделей: в одном и том же контуре на базе VS Code новая модель показала 51,2% на SWE-bench Pro против 35,2% у Haiku. Даже с обычными оговорками к настройке тестов это достаточно большой разрыв, чтобы считать его заметным сдвигом в гонке инженерных ИИ-моделей.