← Все посты

Посты с тегом #оценка моделей

постов: 4

  • AI Benchmarks

    Claude Opus 4.8 (Thinking) вошла в десятку Document Arena

    В рейтинге Document Arena модель Claude Opus 4.8 (Thinking) заняла 10-е место с результатом 1477. Это не смена лидера, но важный сдвиг: у версии 4.8 появилось подтверждённое место в верхней десятке именно по работе с документами, а не только заметность на соседних бенчмарках.

  • Open Source AI

    CeleBERTy Small показывает силу нишевых малых моделей для открытого ИИ

    В свежей подборке с Hugging Face — два разных, но связанных сигнала для открытого ИИ: компактная специализированная модель CeleBERTy Small напоминает о ценности узких решений без гигантского числа параметров, а открытый набор для оценки метапознания проверяет, умеют ли модели замечать собственные ошибки до того, как они испортят цепочку действий.

  • AI worker startups

    Patronus AI привлекла 50 миллионов долларов на цифровые миры для проверки ИИ-агентов

    Patronus AI закрыла раунд серии B на 50 миллионов долларов и делает ставку на симулированные сайты и внутренние системы, где можно безопасно проверять поведение ИИ-агентов до запуска в реальной среде. Для рынка это важный сигнал: инструменты оценки и стресс-проверки агентов быстро превращаются в отдельную и уже хорошо финансируемую категорию.

  • AI Tool Review

    Обзор AI-инструмента за 9 июня 2026: Arena Agent Mode

    Разбираем Arena Agent Mode — сервис, который делает ставку не просто на выполнение задач агентами, а на их сравнение и оценку. Интересный вариант для исследователей и команд, которым важно видеть не только ответ, но и качество работы агента.