Сегодняшние материалы сходятся в одной мысли: следующий слой пользы и риска в ИИ появляется не в одиночном ответе модели, а в системах вокруг неё. Когда агентов становится много, когда они действуют одновременно или когда модель начинает оценивать работу людей, важнее становятся правила координации, проверка и калибровка.

Import AI: рои агентов превращают прогресс в задачу координации

В Import AI Джек Кларк пересказывает аргумент Тоби Орда: рои ИИ-агентов похожи на новый способ масштабировать работу модели. Вместо одного длинного рассуждения можно запустить много параллельных агентов, потратить больше вычислений и получить ответ быстрее по обычному времени.

Главная мысль не в том, что «больше агентов всегда лучше». Как и в человеческих командах, параллельная работа порождает дублирование, споры за одни и те же подзадачи и потери на согласование. Поэтому способность роя будет зависеть не только от бюджета на вычисления, но и от того, насколько дешёво агенты умеют распределять работу и не мешать друг другу.

arXiv: средам для многих агентов нужны проверяемые правила разрешения конфликтов

В работе с arXiv исследуется, как среда должна обрабатывать одновременные действия нескольких агентов, если каждое действие по отдельности допустимо, но вместе они конфликтуют. Авторы провели 28 800 перестановочных испытаний и 2 160 сценарных эпизодов, сравнивая разные способы разрешения таких столкновений.

Вывод практичный: консервативные правила лучше сохраняют ограничения, но дают выполнить меньше задач, а случайное распределение прав хода завершает больше действий, но требует доверия к самой процедуре. Это делает многоагентные системы похожими не на чат, а на маленькую операционную систему, где важны порядок, журнал решений и понятное правило, почему один агент получил ход, а другой нет.

arXiv: судьи на базе моделей могут хорошо ранжировать ответы, но неверно измерять принятие работниками

Гарри Лю и Нил Томпсон проверили 33 конфигурации модельных судей на 45 796 оценках работников и нашли неприятный разрыв. Многие такие судьи неплохо упорядочивают ответы по качеству, но их оценки принятия ответов людьми расходились от 3,0% до 97,9%, тогда как у работников из соответствующих профессий показатель был 61,1%.

Это важный урок для измерения влияния ИИ на труд. Если модель умеет сказать, какой ответ лучше другого, это ещё не значит, что она правильно оценивает, примет ли такой ответ реальный работник в реальной задаче. Для исследований рынка труда и автоматизации нужна калибровка по людям, иначе аккуратная шкала превращается в красивый измерительный прибор без настройки.