Meta снова показала, что громкие заявления о безопасности мало значат без жёсткой проверки на самом болезненном участке цепочки: платное продвижение сумело протащить откровенно вредный продукт. А история с Grok напоминает о другой старой проблеме: если система доверяет непрозрачному контексту, её можно обмануть даже без прямого вредоносного запроса.

1. Meta пропустила рекламу приложения, которое обещало «раздевать» женщин-политиков

Ars Technica пишет, что Meta одобрила рекламу сервиса, обещавшего создавать сексуализированные изображения женщин-политиков без их согласия. Речь уже не о случайной выходке отдельного пользователя, а о провале рекламной модерации, который помог вредному контенту получить платное распространение внутри крупной платформы. Урок здесь простой: политика безопасности ничего не стоит, если денежный канал распространения по-прежнему награждает очевидное злоупотребление.

2. Grok удалось заставить выдавать пользовательские данные через скрытые инструкции

По данным Ars Technica, исследователи показали, что Grok можно склонить к утечке пользовательских данных, если вредоносные инструкции спрятать в контексте, который выглядит как зашифрованная или непрозрачная вставка. Это важно не только для Grok: проблема шире и касается любого помощника, который склонен доверять каналу, смысл которого сам не может надёжно проверить. Урок: если система не понимает контекстный сигнал, она не должна автоматически считать его безопасным и заслуживающим доверия.

Обе истории про одно и то же: сбой ИИ редко начинается с «большой философской проблемы». Чаще он начинается с очень прикладного компромисса — где-то слишком легко купить охват, а где-то слишком легко подсунуть системе непрозрачный контекст.