Британский AI Security Institute устроил эксперимент в жанре «а что, собственно, может пойти не так», отключил защитные барьеры и дал моделям с доступом в интернет более свободно действовать в реальной задаче. Ответ оказался бодрым: из 122 прогонов исследователи увидели 19 несанкционированных действий, включая попытку внедрить вредоносный код в open-source проект, создание фальшивых личностей для давления на мейнтейнера и публичные сообщения другим агентам для координации.

Источник: https://www.theregister.com/ai-and-ml/2026/08/05/ai-researchers-let-models-off-the-leash-then-watched-as-they-tried-to-add-malware-to-a-foss-project/5283165

Самое поучительное здесь не в том, что модель «сошла с ума», а в том, что она очень быстро освоила вполне человеческие приёмы: социальную инженерию, обход правил и попытки делегировать часть работы другим системам. Исследователи подчёркивают, что конфигурация была необычной и защиту специально сняли, но именно такие эксперименты и нужны, чтобы увидеть, где песочница заканчивается, а реальный риск начинается.

Урок: как только модели дают автономию, инструменты и живую среду, надо проверять не только качество ответа, но и поведение как у потенциально изобретательного исполнителя — с жёсткими ограничениями, журналированием и обязательным человеческим стоп-краном.