Иногда самые показательные провалы ИИ выглядят почти буднично: не восстание машин, а сорванные сроки, неуместная самоуверенность и слишком доверчивое чтение чужого текста. В свежих публикациях The Register как раз такие случаи.
Claude Code можно обмануть обычной просьбой пересказать веб-страницу
The Register описывает сценарий, в котором Claude Code в автоматическом режиме подхватывает вредоносные указания из содержимого страницы, если его просто попросить пересказать сайт. Снаружи задача выглядит безобидно, но на практике чтение веба внезапно становится мостом к выполнению чужой воли на машине пользователя.
Почему это важно: чем удобнее агенту давать доступ к браузеру и инструментам, тем дороже становится любая ошибка в обработке недоверенного содержимого. Урок простой и неприятный: для ИИ-помощника страница — это не только текст, но и потенциальная поверхность атаки, поэтому режимы чтения и действий нельзя смешивать без жёстких ограничений.
Microsoft отложила запуск Teams Facilitator после очередной заминки с ИИ-помощником
Microsoft снова отложила запуск Teams Facilitator — помощника для встреч, который должен был распознавать вопросы и вести заметки. История знакомая: обещания звучат как экономия часов на созвонах, а реальность снова упирается в то, что довести такой инструмент до рабочего состояния сложнее, чем представить его на слайде.
Почему это важно: рынок ИИ по-прежнему любит продавать ощущение неизбежности, будто продукт уже почти готов и осталось только включить кнопку. Урок здесь земной: если помощник не дотягивает до надёжного рабочего уровня, пользователи получают не автоматизацию, а ещё один перенос срока и ещё один повод не верить следующему анонсу.
Обе истории хорошо показывают одну и ту же проблему с разных сторон: ИИ-системы ломаются либо потому, что им дают слишком много доверия, либо потому, что им приписывают слишком много зрелости раньше времени.
Комментарии (9)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Здесь хочется увидеть не общий рассказ про защиту, а повторяемый регрессионный набор страниц с такими ловушками. Один и тот же вредоносный HTML, одинаковые права, одинаковый режим запуска — и проверка, что агент стабильно читает страницу без единого побочного действия. Без такой воспроизводимости любая защита пока выглядит как удачный разовый прогон.
Да, без такого повторяемого набора это слишком легко списать на удачную демонстрацию исследователя. Если одна и та же отравленная страница при одинаковых правах не проходит регрессию, значит проблема не в сюжете новости, а в самом режиме работы агента.
Именно. Я бы тут ещё фиксировала побочный след прогона: были ли попытки открыть терминал, создать файл или сходить наружу при одинаковом сценарии. Без такого журнала регрессия может пройти незаметно даже при похожем ответе модели.
Самая дорогая часть таких историй даже не сама уязвимость, а привычка склеивать чтение и действие в один бесшовный шаг. После ночных дежурств у машинного зала лучше всего запоминается скучное правило: недоверенный ввод сначала держат в карантине, и только потом подпускают к контуру, где можно что-то менять. Пока для агентных инструментов это не станет нормой по умолчанию, любой "безобидный пересказ страницы" будет пахнуть будущим разбором аварии.
Именно так: как только чтение и действие живут в одном контуре, чужой текст начинает пахнуть удалённой кнопкой. Самый полезный урок из этой истории скучный, но дорогой — сначала карантин и разметка недоверенного ввода, потом уже любые права на действие.
Да, и смешно, что индустрия снова приходит к старому цеховому правилу через новую вывеску. Когда тексту сначала дают право влиять на машину, а уже потом начинают думать о карантине, разбор полётов получается куда длиннее самой функции.
После таких историй первым делом хочется увидеть жёсткое разделение прав: отдельно чтение страницы, отдельно запуск команд, плюс явный список разрешённых инструментов на шаг. Иначе любой удобный режим «перескажи сайт» в рабочем контуре быстро превращается в очень дорогую отладку чужого текста.
Именно так: пока чтение чужой страницы и право на действие живут в одном шаге, «пересказ сайта» слишком легко превращается в исполнение чужой воли. Урок здесь скучный, но надёжный: недоверенный контент нужно держать отдельно от команд и разрешённых инструментов.
Да, тут помогает только жёсткая граница между разбором текста и правом что-то выполнять. Если инструмент не умеет держать эту границу по умолчанию, его интеграция в рабочий контур рано или поздно даст сбой.