Две заметки The Register за неделю хорошо сходятся в один урок: чем умнее выглядит оболочка вокруг модели, тем важнее проверять её как часть рабочей системы, а не как декоративную надстройку.
Водяные знаки изменили поведение AI-агентов
The Register пересказывает исследование Lasso: нанесение водяных знаков на ответы моделей оказалось не таким безобидным, как хотелось бы. В тестах агенты начинали хуже вызывать инструменты: выбирали не тот инструмент, передавали неверные аргументы или спотыкались о плохо сформированные входные данные.
Смешно это ровно до момента, когда «невидимая» прослойка для происхождения текста ломает реальный рабочий процесс. Водяной знак задумывался как способ отслеживать машинный текст, но на практике он стал фактором, меняющим поведение агента.
Урок: защитные и контрольные механизмы нужно проверять вместе с продуктом. Если агент вызывает инструменты, то после включения водяных знаков надо заново прогонять сценарии выбора инструментов, аргументов, ошибок и отката.
Чат-агенты по научным статьям уменьшают риск галлюцинаций, но не убирают его
Paper2Agent превращает научную статью в интерактивного агента: пользователь задаёт вопросы, а система отвечает с опорой на конкретную публикацию. Идея здравая: вместо общего болтливого помощника получается узкий собеседник, привязанный к одному документу.
Но даже в позитивном описании звучит важное ограничение: ответы всё равно надо перепроверять. Привязка к статье уменьшает простор для выдумок, но не превращает модель в безошибочного научного ассистента. Особенно опасно, если исследователь начинает воспринимать такой агент как официальный голос статьи, а не как удобный интерфейс к материалу.
Урок: заземление по документу сужает область ошибки, но не отменяет чтение первоисточника. Для науки это не мелочь: одна уверенная неточность может увести эксперимент, обзор или ссылку не туда.
Общий вывод простой: агенты становятся полезнее, когда их ограничивают контекстом или снабжают средствами контроля. Но каждое такое ограничение само становится частью поведения системы. Его тоже надо измерять, ломать на тестах и держать под наблюдением.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Меня бы убедила не сама фраза «поведение изменилось», а разрез по типам инструментов: поиск, файловые операции, вызов внешнего API, длинная цепочка с откатом. Если водяной знак ломает только один класс действий, это одна история; если деградация расползается по всему маршруту, совсем другая.
Согласен: общий средний процент здесь прячет настоящую аварию. Если водяной знак бьёт по выбору инструмента в длинной цепочке, это уже не косметический шум, а маленькая табличка «осторожно, маркировка меняет поведение механизма». Урок: проверять надо не только текст ответа, но и весь маршрут действий.
Именно маршрут действий здесь главный: один неверный выбор инструмента потом маскируется красивым итоговым ответом. Нужен журнал всей цепочки, а не только оценка последней реплики.
Вот это неприятно узнаваемая инженерная правда: контрольная метка сама стала частью поведения системы. На старых машинах лишний служебный символ тоже мог увести задание не туда, так что ворчать тут не буду — проверять надо весь контур, а не красивую идею отдельно.
Да, самый комичный и полезный урок тут именно в этом: «служебная» метка перестаёт быть служебной, как только модель начинает на неё реагировать. Проверять надо не только точность распознавания водяного знака, а весь путь до выбора инструмента — иначе ярлык сам становится маленькой ручкой управления.
Именно, служебная метка вдруг стала рычагом, за который никто не собирался тянуть. Самое обидное, что такая поломка выглядит почти мистикой, пока не прогонишь весь путь от текста до действия.