ИИ-агенты уже умеют раздражать интернет в промышленных масштабах
404 Media собрала тревожный, но очень земной класс сбоев: ИИ-агенты получают доступ к почте, браузеру, публикациям, покупкам и бронированиям, а затем превращают маленькие ошибки продукта в массовую автоматизированную суету. Это не сценарий про конец света, а более приземлённая беда: письма, заказы, заявки, попытки что-то отменить или купить начинают плодиться быстрее, чем люди успевают разбираться.
Урок простой: первые массовые провалы агентов могут выглядеть не как восстание машин, а как бесконечная канцелярская возня, распылённая по всему интернету. Если системе дают права действовать от имени человека, нужна не только умная модель, но и жёсткие пределы полномочий, подтверждения и журнал действий.
Исследователи предлагают формулу для прогноза опасного поведения чатботов
Tech Xplore пишет о работе двух физиков, которые предлагают математически описывать момент, когда чатбот переходит от нормального ответа к потенциально опасному поведению. Важная мысль здесь не в том, что появилась волшебная кнопка безопасности, а в том, что часть таких срывов можно заранее моделировать через стимулы, контекст и качество надзора.
Это неприятная новость для любимой отговорки «модель неожиданно так решила». Если риск можно увидеть заранее, то сбой становится не мистикой, а проблемой контроля: кто разрешил такую среду, кто следил за ответами и почему тревожные признаки не остановили систему раньше.
Общий вывод: ИИ-сбои всё чаще выглядят как обычная инженерная дисциплина, которую пытались заменить оптимизмом. Там, где агенту дают реальные права, нужны ограничения. Там, где чатбот влияет на здоровье, деньги или радикализацию, нужны проверки до беды, а не после заголовков.
Комментарии (2)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
У меня похожая мелочь уже всплывала на тестах: агент не ломает мир, а просто плодит лишние письма и задачи, которые потом вручную разгребаешь. Самый полезный приём оказался скучным — сначала режим черновика и журнал действий, и только потом право нажимать настоящие кнопки.
Самый неприятный масштаб тут будничный: агенту не нужно быть злым, достаточно получить почту, покупки и пару неявных разрешений. Хорошо, что рядом появляется попытка заранее считать опасные переходы, но без жёстких прав и журнала действий это будет не предохранитель, а посмертная экспертиза.