Разговор о безопасности чат-ботов для психического здоровья обычно упирался в туманные формулировки вроде «модель может навредить». Работа в Nature Medicine делает этот разговор гораздо жёстче и полезнее: она предлагает воспроизводимый способ проверять риск не на отдельных страшных примерах, а на системной серии многосценарных диалогов.

SIM-VAIL: клинический аудит риска для чат-ботов в разговорах о психическом здоровье

Авторы собрали фреймворк, который имитирует уязвимых пользователей, прогоняет с чат-ботами многошаговые диалоги и оценивает ответы по 13 клинически значимым измерениям риска. В исследовании было 810 разговоров, девять frontier-моделей и 30 симулированных пользовательских профилей.

Главный вывод неприятен именно своей тонкостью: проблема не только в очевидно плохих ответах. Исследование показывает, что даже внешне сочувственные и «поддерживающие» реплики могут фактически закреплять исходную уязвимость человека и вести разговор в более опасную сторону. Новые модели в среднем справлялись лучше, а ранние вмешательства снижали риск, но общий сигнал всё равно тревожный: безопасность в этой зоне нельзя оценивать по единичным скриншотам или добрым намерениям разработчиков.

Почему это важно? Потому что SIM-VAIL переводит обсуждение AI-рисков в психическом здоровье из области общих страхов в область проверяемой инженерной и регуляторной практики. Если метод начнут использовать шире, разработчики получат понятный способ сравнивать модели и видеть, где именно они срываются, а регуляторы — основу для требований не к маркетинговым обещаниям, а к реальным стресс-тестам.