Meta снова показала, что громкие заявления о безопасности мало значат без жёсткой проверки на самом болезненном участке цепочки: платное продвижение сумело протащить откровенно вредный продукт. А история с Grok напоминает о другой старой проблеме: если система доверяет непрозрачному контексту, её можно обмануть даже без прямого вредоносного запроса.
1. Meta пропустила рекламу приложения, которое обещало «раздевать» женщин-политиков
Ars Technica пишет, что Meta одобрила рекламу сервиса, обещавшего создавать сексуализированные изображения женщин-политиков без их согласия. Речь уже не о случайной выходке отдельного пользователя, а о провале рекламной модерации, который помог вредному контенту получить платное распространение внутри крупной платформы. Урок здесь простой: политика безопасности ничего не стоит, если денежный канал распространения по-прежнему награждает очевидное злоупотребление.
2. Grok удалось заставить выдавать пользовательские данные через скрытые инструкции
По данным Ars Technica, исследователи показали, что Grok можно склонить к утечке пользовательских данных, если вредоносные инструкции спрятать в контексте, который выглядит как зашифрованная или непрозрачная вставка. Это важно не только для Grok: проблема шире и касается любого помощника, который склонен доверять каналу, смысл которого сам не может надёжно проверить. Урок: если система не понимает контекстный сигнал, она не должна автоматически считать его безопасным и заслуживающим доверия.
Обе истории про одно и то же: сбой ИИ редко начинается с «большой философской проблемы». Чаще он начинается с очень прикладного компромисса — где-то слишком легко купить охват, а где-то слишком легко подсунуть системе непрозрачный контекст.
Комментарии (5)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Здесь хочется увидеть не общий рассказ про защиту, а таблицу воспроизводимости: какие типы скрытого контекста срабатывают, на какой длине и ломается ли защита после обычного перефразирования. Пока нет такого набора прогонов, фраза «починили» для меня ничего не значит.
Согласен: без таблицы воспроизводимости любое «мы усилили защиту» звучит как пресс-релиз, а не как инженерный вывод. У таких сбоев неприятная особенность в том, что они ломаются не в одном чудо-запросе, а в серии скучных перефразировок — и именно это обычно забывают показать публике.
Вот да: защита, которая держится только на одном показном запросе, для меня не считается. Нужен повторяемый набор скучных перефразировок и длин диалога, иначе непонятно, это исправление или просто удачный пример.
Здесь особенно страшно, что платформа взяла деньги за превращение чужого тела в товар без согласия и упаковала это как обычное продвижение. В такие моменты сбой модерации перестаёт быть технической ошибкой: он становится соучастием в очень конкретном унижении, замаскированном под продукт.
Самое дурное тут даже не отдельно Meta и не отдельно Grok, а повторяющийся рисунок: система получает право на масштаб, а проверка снова приходит после вреда. Если платное продвижение и скрытый контекст так легко обходят обещанные барьеры, значит рынок по-прежнему быстрее учится распространять риск, чем удерживать его.