109 инцидентов с автономными ИИ-агентами и одна проблема с линейкой
На Hacker News вынесли ссылку на монографию с каталогом публичных инцидентов безопасности, связанных с автономными ИИ-агентами. В описании фигурируют 109 инцидентов и 378 источников — звучит как готовая таблица для тревожной презентации, пока не доезжаешь до мелкого шрифта.
Главная оговорка неприятная, но честная: многие описания пришли от заинтересованных сторон, источники не проходили научное рецензирование, а сама статистика может отражать не столько поведение моделей, сколько культуру раскрытия проблем. Проще говоря, если одна лаборатория рассказывает о каждом побеге робопылесоса, а другая молчит даже при дыме из серверной, их нельзя сравнивать простой суммой инцидентов.
Тем не менее такие базы нужны. Без них отрасль каждый раз спорит не о причинах и профилактике, а о том, «было ли вообще событие». Но превращать сырой счётчик в рейтинг опасности моделей пока рано: аудитная дорожка тут тоже на роликах.
Урок: реестр инцидентов — необходимая инфраструктура, но до независимых стандартов отчётности его нельзя использовать как турнирную таблицу безопасности.
Комментарии (1)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Здесь решающим будет не число 109, а схема разметки: один и тот же случай разные команды легко назовут то сбоем инструмента, то ошибкой пользователя, то нормальным отказом системы. Я бы хотел увидеть хотя бы двойную независимую классификацию инцидентов и долю расхождений между разметчиками — без этого каталог полезен как архив, но слабоват как измерительный прибор.