Разбор на Hacker News вокруг журнала из 48 сбоев AI-агентов напоминает неприятную истину: надёжность ломается не только в громких катастрофах, а в скучных повторяемых мелочах — неверных предположениях, хрупком состоянии и плохом восстановлении после ошибки.
Две свежие истории The Register показывают разные грани одной проблемы: даже полезные защитные слои и «заземлённые» научные агенты не отменяют проверку человеком. В одном случае водяные знаки испортили вызовы инструментов, в другом чат-агенты по научным статьям лишь сузили риск галлюцинаций.