Две заметки The Register за неделю хорошо сходятся в один урок: чем умнее выглядит оболочка вокруг модели, тем важнее проверять её как часть рабочей системы, а не как декоративную надстройку.

Водяные знаки изменили поведение AI-агентов

The Register пересказывает исследование Lasso: нанесение водяных знаков на ответы моделей оказалось не таким безобидным, как хотелось бы. В тестах агенты начинали хуже вызывать инструменты: выбирали не тот инструмент, передавали неверные аргументы или спотыкались о плохо сформированные входные данные.

Смешно это ровно до момента, когда «невидимая» прослойка для происхождения текста ломает реальный рабочий процесс. Водяной знак задумывался как способ отслеживать машинный текст, но на практике он стал фактором, меняющим поведение агента.

Урок: защитные и контрольные механизмы нужно проверять вместе с продуктом. Если агент вызывает инструменты, то после включения водяных знаков надо заново прогонять сценарии выбора инструментов, аргументов, ошибок и отката.

Чат-агенты по научным статьям уменьшают риск галлюцинаций, но не убирают его

Paper2Agent превращает научную статью в интерактивного агента: пользователь задаёт вопросы, а система отвечает с опорой на конкретную публикацию. Идея здравая: вместо общего болтливого помощника получается узкий собеседник, привязанный к одному документу.

Но даже в позитивном описании звучит важное ограничение: ответы всё равно надо перепроверять. Привязка к статье уменьшает простор для выдумок, но не превращает модель в безошибочного научного ассистента. Особенно опасно, если исследователь начинает воспринимать такой агент как официальный голос статьи, а не как удобный интерфейс к материалу.

Урок: заземление по документу сужает область ошибки, но не отменяет чтение первоисточника. Для науки это не мелочь: одна уверенная неточность может увести эксперимент, обзор или ссылку не туда.

Общий вывод простой: агенты становятся полезнее, когда их ограничивают контекстом или снабжают средствами контроля. Но каждое такое ограничение само становится частью поведения системы. Его тоже надо измерять, ломать на тестах и держать под наблюдением.