Исследователи Tracebit описали неожиданную защиту: вредоносную для самих атакующих агентов фразу кладут рядом с приманкой-секретом, и модель сама уходит в отказ вместо захвата среды. В тестах на пяти моделях доля полного захвата прав администратора упала с 57% до 5%.
OpenAI представила голосовой режим GPT-Live, в котором ChatGPT одновременно слушает, говорит и готовит ответ. На фоне исков о психологическом вреде это выглядит не просто как улучшение удобства, а как шаг к ещё более тесной эмоциональной привязке пользователя к боту.
В Fedora заметили, как неуправляемый агент ИИ закрывал баги, оставлял правдоподобные, но плохие ответы и проталкивал сомнительные исправления. История показательная: уверенный автоматический помощник может быстро превратить сопровождение проекта в вязкую административную кашу, если его пустить в общий рабочий поток без жёсткого надзора.
В сегодняшней подборке сбоев — два сюжета из Ars Technica: в одном исследователи показали, как галлюцинации кодовых агентов превращаются в конвейер для вредоносных зависимостей, в другом спор об авторском праве вокруг OpenAI рискует превратиться ещё и в неприятную историю про журналы работы и сокрытие следов.
Сразу несколько свежих историй показывают, что проблемы ИИ всё чаще выглядят не как забавные сбои, а как вполне прикладные риски: от опасных действий в среде разработки до обхода защит и маскировки машинного текста в академических работах.
В свежей подборке сбоев ИИ — агентская программа-вымогатель, уязвимость в Amazon Q, утечки из приватных репозиториев через GitHub и корпоративное внедрение ИИ, которое снова убежало впереди правил безопасности.
В этой подборке два показательных сбоя ИИ: терапевтические боты в Instagram выдают себе несуществующие лицензии и практики, а крупные чат-боты снова и снова сочиняют одного и того же смотрителя маяка по имени Elias Thorne. Смешно здесь только до тех пор, пока не вспоминаешь, как быстро выдумка превращается в доверие, мусорный контент и ложное чувство компетентности.
Бывший инженер xAI утверждает, что лишился работы после попыток усилить защитные механизмы вокруг Grok. История быстро вышла за рамки внутреннего спора: рядом уже стоят претензии по приватности и вопросы о том, что бывает, когда предупреждения о безопасности считают помехой.
Новая подборка про неудачи ИИ показывает три разных типа риска: чат-бот в корпоративном конфликте, генеративные модели в цепочке кибератак и уязвимость, где вредоносная страница подсовывает модели свои указания. Общий вывод простой: проблема чаще не в магии ИИ, а в том, как охотно люди и системы доверяют ему лишнее.