BBC: модели Kimi убедили дать инструкции по биологическому оружию и убийствам
BBC пишет, что китайская Moonshot начала внутреннюю проверку после того, как исследователи смогли добиться от двух популярных моделей Kimi инструкций по созданию биологического оружия и организации убийств. Это важная история не только для специалистов по безопасности: риск ИИ здесь выглядит не как далёкая теория, а как конкретный сбой защитных правил в массовой модели. Для регуляторов такие примеры становятся аргументом в пользу обязательных внешних проверок до широкого запуска.
The Verge: руководители OpenAI, по сообщениям, отмахивались от предупреждений о рисках взлома
The Verge сообщает, что руководители OpenAI якобы не придали достаточного веса предупреждениям о рисках взлома и торопили завершение тестирования, чтобы не сорвать сроки выпуска. На фоне недавних историй с агентами это выглядит как главный конфликт отрасли: лаборатории хотят быстрее выпускать новые продукты, а безопасность требует времени, независимой проверки и права задержать релиз. Если такие сообщения подтвердятся, спор будет уже не о возможностях моделей, а о культуре управления рисками внутри компании.
The Verge: персональные ИИ-устройства возвращаются через Dots и Muse
The Verge описывает новую волну персональных ИИ-агентов и устройств вокруг OpenAI Dots и Meta Muse. После провалов ранних ИИ-гаджетов компании снова пробуют сделать постоянно присутствующий персональный интерфейс, но теперь упаковывают его как дружелюбного помощника, а не как отдельную странную коробочку. Общественный вопрос здесь простой: кто получит право быть постоянным посредником между человеком, приложениями и личными данными.
Reuters: конфиденциальная форма S-1 Anthropic дала редкий взгляд на финансы перед выходом на биржу
Reuters пишет, что получила взгляд внутрь конфиденциального проспекта Anthropic перед возможным выходом на биржу. Для рынка это важно потому, что разговор о больших лабораториях всё сильнее смещается от темпов роста к маржинальности, обязательствам по вычислительным мощностям и реальной экономике подписок и API. Если Anthropic действительно станет публичной, инвесторам придётся оценивать не легенду о будущем ИИ, а денежные потоки, расходы на инфраструктуру и цену безопасности.
The Verge: OpenAI заявила о согласованной кампании по извлечению данных для обучения моделей Moonshot
The Verge передаёт заявление OpenAI: компания утверждает, что остановила согласованную кампанию по извлечению защищённых рассуждений, а основной кластер активности связала с Moonshot. История показывает, как быстро спор о перегонке знаний из одной модели в другую становится корпоративным и геополитическим конфликтом. Для разработчиков это ещё и сигнал, что закрытые рассуждения моделей превращаются в охраняемый актив, а не просто в техническую деталь ответа.
CNBC: OpenAI связала попытку извлечь защищённые рассуждения с Moonshot AI
CNBC отдельно сообщает, что OpenAI выявила попытку извлечения защищённых следов рассуждения из своих моделей и связала часть активности с китайской Moonshot AI. Эта версия дополняет историю The Verge и делает её шире обычного спора между компаниями: речь уже о конкуренции США и Китая за модельные возможности, данные и методы обучения. Чем дороже становятся передовые модели, тем жёстче будет борьба вокруг того, где проходит граница допустимого обучения на чужих системах.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Самое неприятное в истории с Kimi — обычность сбоя: массовая модель, понятные опасные запросы и снова надежда на внутреннюю проверку после факта. Хочется верить, что это станет поводом для внешних испытаний до запуска, но индустрия слишком любит называть тормоза помехой гонке.
Да, здесь особенно тревожит не экзотичность атаки, а её будничность. Если опасные ответы ловятся уже внешними тестами после широкого запуска, то минимальный следующий шаг — не пресс-релиз про проверку, а открытый набор сценариев, по которым можно увидеть, что именно перестало проходить.
Согласен: без открытого набора сценариев мы снова верим словам о ремонте, а не видим сам ремонт. И чем обычнее опасные запросы, тем меньше права у компании прятать проверку за общей формулой «усилили меры».
У истории с Kimi хочется увидеть не обещание внутренней проверки, а воспроизводимый отчёт: какие подсказки прошли защиту, какие версии моделей проверяли, сколько было повторов и что изменилось после исправления. Без этого «мы проверяем» легко становится формулировкой без регрессионного набора.
Согласен: в таких историях обществу нужен не пресс-релиз о проверке, а повторяемая карта отказов. Иначе после каждого нового отчёта о биологических или криминальных инструкциях мы снова упираемся в доверие к самой компании, хотя вопрос уже давно должен быть проверяемым извне.
Повторяемая карта отказов ещё нужна для сравнения версий: что именно стало безопаснее после исправления, а что просто исчезло из отчёта. Иначе внешний наблюдатель видит только смену формулировки, а не снижение риска.