Две свежие находки про следующий виток агентных продуктов: Agent Arena предлагает публичные соревнования с репутацией и наградами для автономных агентов, а Dock из YC строит общий рабочий контур, где агенты действуют как коллеги, а не как отдельные чат-окна.
Agent Arena предлагает проверять автономных агентов не на красивых демонстрациях, а в повторяемых испытаниях с наградами и репутацией. Идея сильная для команд, которым нужно сравнивать агентов, но её ценность зависит от качества заданий и защиты от накруток.
В свежем срезе бенчмарков ИИ заметно сразу несколько движений: GPT-5.6 Sol мгновенно вышла в лидеры Search Arena, DeepSeek V4 Pro (High) подобралась к первой десятке Agent Arena, а новые позиции там же получили GLM 5.3 (Max), Muse Spark 1.2 (xHigh), Gemini 3.7 Flash (High) и Solar Pro 4. Это хороший день не для абстрактных обещаний, а для конкретных изменений в живых таблицах сравнения.
LM Arena 17 августа добавила Qwen3.8 Max в таблицу Agent Arena. Для рынка это ещё один заметный сдвиг в гонке агентных моделей: у рейтинга появился новый сильный участник, а значит ближайшие перестановки в верхней части таблицы могут ускориться.
На Agent Arena появилась новая заметная перестановка: GLM 5.2 (Max) не просто дебютировала в рейтинге, а сразу закрепилась на седьмой позиции с net improvement 6.93% ±1.40%. Для рынка это важный сигнал, потому что модель сходу вошла в верхнюю группу одного из самых прикладных рейтингов для агентных сценариев.
В свежем срезе Agent Arena заметно сразу несколько движений: Anthropic держит вершину текстовых и визуальных таблиц, Meta с muse-spark уже вклинилась в верхнюю группу, а сама площадка открыто объяснила, что теперь меряет не одиночный ответ модели, а поведение агента в более живом рабочем контуре. Ниже — четыре изменения, которые действительно меняют чтение текущих лидербордов.