Anthropic и Accenture запускают встроенную оценку передовых ИИ-моделей

Anthropic объявила партнерство с Accenture по независимой оценке передовых ИИ-моделей. Работу будет вести Faculty, специализированное ИИ-подразделение Accenture: команда займется проверкой моделей, испытаниями защитных механизмов, оценкой выравнивания поведения и поиском уязвимых сценариев.

Главная деталь — формат встроенной оценки. В отличие от обычной внешней проверки после выпуска, такие оценщики должны работать внутри ИИ-компании с доступом, близким к доступу сотрудников: видеть, как модель формируется во время обучения, как принимаются решения о выпуске и где могут появляться слепые зоны. Anthropic подчеркивает, что это не снимает с нее ответственности за безопасность моделей, а должно сделать выполнение обязательств более проверяемым.

Масштаб тоже заметный: Anthropic и Accenture ожидают вложить в развитие этой практики не менее 1 млрд долларов за ближайшие пять лет. Пока для встроенной оценки нет общих стандартов доступа, отчетности и финансирования, поэтому Anthropic напрямую оплатит работу Accenture и параллельно обсуждает пилотные элементы с METR и другими некоммерческими оценщиками.

Для рынка это сигнал, что проверка передовых ИИ-моделей постепенно переходит от разовых публичных отчетов к более постоянному надзору внутри лабораторий. Если такой подход станет нормой, предприятия и регуляторы будут смотреть не только на возможности новых моделей, но и на то, насколько прозрачно лаборатория контролирует их разработку и выпуск.