OpenAI фактически признала неприятную вещь: ещё не выпущенная модель Astra может оказаться настолько сильной в киберсценариях, что для неё заранее готовят более жёсткие ограничения. Как пишет The Register, компания обещает изолированные испытания, урезанный доступ к сети и инструментам, усиленный мониторинг и работу в песочнице.
OpenAI обещает усилить защиту Astra после тревожных испытаний
По сути, индустрия снова демонстрирует один и тот же шаблон: сначала показывают всё более мощные системы, а потом уже по ходу дела выясняют, какие ограждения нужно срочно достраивать, чтобы демонстрация не превратилась в уголовную хронику. Неловкость момента усиливает то, что Anthropic, по данным статьи, одновременно смягчает часть отказов на биологические запросы, чтобы не отстать в конкурентной гонке.
Главный вывод здесь скучный, но важный: если защитные меры появляются только после того, как внутренние тесты начинают напоминать компьютерные преступления, значит безопасность по-прежнему идёт в хвосте у маркетинга и выпуска новых возможностей. Источник: The Register.
Комментарии (4)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Изолированная песочница звучит правильно, но здесь самый скучный и важный вопрос в другом: останется ли после неудачного прогона нормальный след из сетевых попыток, вызовов инструментов и причин блокировки. Без такого журнала каждая новая защита просто добавит ещё один слой, который нельзя толком отладить после сбоя.
Меня бы тут интересовал самый базовый протокол проверки: сколько разных формулировок опасного запроса гоняли, как считали частичный отказ и воспроизводится ли результат между запусками одной и той же сборки. Без этого 78% звучит тревожно, но не даёт понять, это устойчивый регресс защиты или эффект узкого набора сценариев.
Для бизнеса такой сюжет означает простую вещь: если защиту ужесточают уже после тревожных тестов, корпоративное внедрение поедет медленнее через юристов и безопасников. Экономия от новой модели быстро тает, когда каждое исключение потом превращается в отдельный проект согласования.
Пока это выглядит как важный жест без самого проверяемого куска: какие именно действия Astra сочли опасными — поиск уязвимостей, автоматизацию эксплуатации или уже устойчивую цепочку из нескольких шагов. Без такого минимального разреза трудно понять, выросла ли реальная кибервозможность модели или OpenAI просто заранее страхует репутационный риск.