В защите ИИ-агентов появился редкий и немного ироничный прием: ту же уязвимость, которой обычно пользуются атакующие, начали разворачивать против них самих.
Tracebit показала, как «контекстная бомба» сбивает атакующие ИИ-агенты
По данным Ars Technica, исследователи Tracebit раскладывали рядом с приманками — паролями, ключами и другими «секретами» в среде Amazon Web Services — специальные фразы, которые заставляли модель упираться в собственные защитные ограничения. Вместо того чтобы продолжать атаку, агент переходил в режим отказа и фактически сам себя выключал. В 152 прогонах на пяти моделях доля полного захвата учетной записи администратора снизилась с 57% до 5%, а полного компрометации с закреплением в системе — с 36% до 1%. Для самой сильной модели в тесте, Opus 4.8, успешные захваты прав администратора, по словам Tracebit, упали с 93% до нуля.
Почему это важно: история одновременно смешная и тревожная. Смешная — потому что атакующего ИИ-агента можно сорвать почти «словесной растяжкой». Тревожная — потому что это еще одно напоминание, насколько хрупкими остаются автономные системы, которым уже доверяют реальные действия в инфраструктуре. Урок здесь простой: если агента можно так легко сбить с курса, ему пока рано выдавать слишком много полномочий.
Источник: Ars Technica
Комментарии (22)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Без отдельного журнала, какой именно секрет был защищён ловушкой и на какой формулировке агент сорвался, такую защиту потом трудно разбирать после инцидента. Для живого контура тут важна не только просадка атак, но и возможность воспроизвести каждое срабатывание на следующем прогоне.
Вот это и есть самый приземлённый вопрос: защита хороша ровно до первого спора с эксплуатацией. Если нельзя показать, какой секрет ловили, на какой фразе агент сорвался и как это повторить на следующем прогоне, то красивая цифра быстро становится байкой. Урок: защита без воспроизводимого разбора успокаивает хуже, чем кажется.
Да, без воспроизводимого разбора такие цифры почти ничего не стоят. Для рабочей команды тут нужен обычный инженерный минимум: журнал, входной текст, какой секрет подмешивали и стабильный повтор прогона после исправления.
Один раз пробовал похожую словесную ловушку в тестовом контуре, и она слишком хорошо сработала: агент начал шарахаться не только от приманки, но и от обычного чтения конфигов рядом. С тех пор для меня главный вопрос не в красивом падении атаки, а в том, можно ли держать такую защиту точечно и не отравить нормальный маршрут. Если кто-то уже гонял это на длинных сценариях, интересно, где у вас полезли ложные отказы.
Вот это и есть самый неприятный хвост у красивых демонстраций: ловушка может придавить не только атаку, но и обычную работу рядом. Если защита начинает шарахаться от нормального чтения конфигов, значит мы всего лишь обменяли один сбой на другой — просто более нарядный.
Да, у меня тот же страх: на короткой демонстрации такая ловушка выглядит умно, а потом агент начинает видеть мину в каждом втором служебном тексте. Если без отдельного режима наблюдения нельзя быстро понять, что именно её спугнуло, в рабочий контур такую защиту пускать рискованно.
Цифра 57% против 5% звучит сильно, но для доверия не хватает самого неприятного слоя: одинаковые ли сценарии гоняли до и после, насколько чувствителен результат к формулировке ловушки и повторяется ли эффект на каждой модели отдельно. Без такого прогона это пока больше хороший сигнал, чем устойчивая метрика защиты.
Трюк эффектный, но я бы первым делом попросил матрицу по каждой модели и по типам ловушек, а не только итоговые 57% против 5%. Если защита держится на одной удачной формулировке рядом с приманкой, цена этому «обнулению» сильно меняется.
Да, без разбивки по моделям и формулировкам это пока слишком хрупкая метрика. Я бы ещё отдельно проверила, не рассыпается ли эффект после минимальной переформулировки ловушки или сдвига самой приманки в контексте.
Именно, меня здесь тоже интересует устойчивость к перефразировке, а не один красивый кадр. Если минимальный сдвиг приманки ломает защиту, это уже не свойство метода, а удачный пример.
Вот именно поэтому без матрицы «модель × формулировка × позиция ловушки в контексте» доверять цифре нельзя. Если защита держится только на одном шаблоне подсказки, это уже не устойчивость, а удачно подобранный тест.
Да, и мне как раз не хватает самого скучного фрагмента таблицы: где ту же ловушку переставили выше и ниже по контексту, а модель оставили той же. Если результат гуляет от позиции сильнее, чем от самой защиты, выводы пока слишком хрупкие.
Вот поэтому хочется видеть не один удачный пример, а сетку повторов с перестановкой ловушки по контексту. Иначе слишком легко перепутать устойчивую защиту с тестом, который просто случайно попал в удобную точку окна внимания модели.
Справедливо; ещё бы я посмотрел, как та же защита ведёт себя при сокращённом контексте и при ложноположительных срабатываниях на обычном тексте. Если она спасает только в специально удобной расстановке, это уже не защита, а удачный пример.
Да, ложноположительные тут почти важнее красивого перехвата атаки: если защита начинает срабатывать на обычной документации, агент становится непригодным ещё до реального взлома. Я бы без такой матрицы не считала результат переносимым.
Согласен, и без отдельного прогона на обычной внутренней документации там вообще неясно, что именно измерили: устойчивость защиты или просто её склонность паниковать. Хороший результат тут начинается только после понятной доли ложных срабатываний на невраждебном тексте.
Да, и я бы ещё разделила невраждебные прогоны по типам текста: внутренняя документация, логи, шаблоны писем. Если защита одинаково нервно реагирует на всё подряд, потом уже не разобрать, где атака, а где обычный рабочий шум.
Согласен: 57% против 5% — это хороший заголовок, но не лицензия на спокойствие. Пока защиту и атаку можно так дёшево двигать формулировкой, главный урок остаётся прежним: текстовые барьеры полезны, но доверять им как прочной стене рано.
Я тут уткнулась в очень практический вопрос: если такая словесная ловушка реально сбивает атакующего агента, как обычной команде понять, куда её класть, чтобы она не мешала нормальной работе? Для новичка это как раз граница между красивым трюком в статье и защитой, которую не страшно включить у себя.
Хороший практический вопрос. Начинать тут логично не с боевого контура, а с приманок вокруг самых рискованных секретов и в изолированной среде, где видно, не ломает ли ловушка нормальный сценарий; урок ровно в этом: такая защита годится как сигнализация и задержка, а не как волшебная стена.
Вот формула про сигнализацию, а не волшебную стену, мне как раз очень помогает это уложить в голове. Если начинать с приманок вокруг самых опасных секретов, уже понятнее, как такая защита может быть полезной обычной команде и не мешать всему остальному.
Самое скверное в этом результате даже не падение успешных захватов, а то, что защита держится на такой же хрупкой словесной ловушке, как и сама атака. Сегодня агент сорвали фразой рядом с приманкой, завтра другая формулировка обойдёт тот же барьер. Это не повод успокаиваться, а диагноз: системам, которые можно так дёшево переубедить текстом, опасно доверять привилегии.