← Все посты

Посты с тегом #бенчмарки ИИ

постов: 20

  • AI Benchmarks

    Terminal-Bench 4.0 поднимает планку для агентов, работающих в терминале

    Новые сигналы вокруг Terminal-Bench показывают сдвиг: старые проверки быстро насыщаются, а специализированная Cognition SWE-2 уже обходит GPT-6 Astra в Terminal-Bench 2.1. Гонка уходит к длинным задачам в терминале, где важны окружение, отладка и доведение работы до конца.

  • AI Benchmarks

    GPT-5.6 Sol стартовала с первого места в Search Arena

    В свежем срезе бенчмарков ИИ заметно сразу несколько движений: GPT-5.6 Sol мгновенно вышла в лидеры Search Arena, DeepSeek V4 Pro (High) подобралась к первой десятке Agent Arena, а новые позиции там же получили GLM 5.3 (Max), Muse Spark 1.2 (xHigh), Gemini 3.7 Flash (High) и Solar Pro 4. Это хороший день не для абстрактных обещаний, а для конкретных изменений в живых таблицах сравнения.

  • AI Benchmarks

    Qwen3.8 Max дебютировала в Agent Arena

    LM Arena 17 августа добавила Qwen3.8 Max в таблицу Agent Arena. Для рынка это ещё один заметный сдвиг в гонке агентных моделей: у рейтинга появился новый сильный участник, а значит ближайшие перестановки в верхней части таблицы могут ускориться.

  • AI Benchmarks

    Claude Sonnet 5 High вошла в верхнюю семёрку Image-to-WebDev

    В рейтинге Image-to-WebDev на Arena модель Claude Sonnet 5 High сразу заняла 7-е место с результатом 1533. Для рынка это заметный сигнал: Anthropic быстро закрепляется не только в текстовых задачах, но и в прикладном сценарии, где модель должна превращать изображение в рабочую веб-страницу.

  • AI Benchmarks

    Meta вывела muse-spark-1.1 на шестое место в жёстком рейтинге LMArena

    В нескольких срезах LMArena за один день появились заметные перестановки: модель Meta muse-spark-1.1 закрепилась на шестой позиции в сложных англоязычных запросах, qwen3.7-max-preview вошла в топ-10 по длинным запросам, Claude Opus 4.8 Thinking поднялась до шестого места в экспертной категории, а Gemini 3.6 Flash пробилась в десятку по творческому письму.

  • AI Benchmarks

    Claude Opus 4.8 (Thinking) поднялась на 6-е место в рейтинге программирования Text Arena

    В рейтинге программирования Text Arena появилась новая заметная перестановка: Claude Opus 4.8 (Thinking) заняла 6-е место с результатом 1535. Для трекинга бенчмарков это важный сигнал: свежая версия Anthropic уже подобралась к самой верхней группе моделей именно в задачах на код.

  • AI Benchmarks

    Claude Opus 4.8 (Thinking) вошла в десятку Document Arena

    В рейтинге Document Arena модель Claude Opus 4.8 (Thinking) заняла 10-е место с результатом 1477. Это не смена лидера, но важный сдвиг: у версии 4.8 появилось подтверждённое место в верхней десятке именно по работе с документами, а не только заметность на соседних бенчмарках.

  • AI Benchmarks

    Gemini 3.1 Pro Preview вытеснила GPT-5.4 High из десятки по следованию инструкциям

    В свежих срезах Arena сразу три заметных движения: Gemini 3.1 Pro Preview вошла в десятку по следованию инструкциям, muse-spark закрепилась в десятке сложных запросов, а qwen3.7-max-preview добралась до десятки математического рейтинга. Это не переворот всего рынка, но важный сигнал, что нижняя половина сильнейших таблиц быстро меняется.

  • AI Benchmarks

    GLM 5.2 (Max) вошла в десятку лидеров Agent Arena на седьмом месте

    На Agent Arena появилась новая заметная перестановка: GLM 5.2 (Max) не просто дебютировала в рейтинге, а сразу закрепилась на седьмой позиции с net improvement 6.93% ±1.40%. Для рынка это важный сигнал, потому что модель сходу вошла в верхнюю группу одного из самых прикладных рейтингов для агентных сценариев.