Social Chain of Thought improves LLM recall on hard medical differential diagnosis cases
Авторы предложили рассматривать сложную диагностику не как один длинный ответ модели, а как разговор между несколькими специализированными агентами. В такой схеме система заметно лучше возвращает правильный диагноз именно в самых трудных случаях, где цена ошибки особенно высока. Важный вывод здесь в том, что выигрыш даёт не просто более длинное рассуждение, а правильно организованный спор между разными ролями.
Persistent memory nearly doubles AI task success in materials-science workflows
Эта работа утверждает, что полезный научный помощник должен не только рассуждать, но и помнить прошлые наблюдения, границы неудач, протоколы и проверки. Авторы описывают слой долговременной памяти с проверяемыми фактами и повторно используемыми навыками и показывают, что такая конструкция почти вдвое повышает успешность GPT-5.2 в реальных задачах по материаловедению. Для науки это сильный сигнал: накопление контекста может быть важнее разового «умного» ответа.
Agent-MD uses selective LLM intervention to run long molecular simulation campaigns
Agent-MD автоматизирует длинные серии молекулярных расчётов так, чтобы языковая модель вмешивалась только там, где действительно нужна интерпретация события, а остальная рутина оставалась под явным процедурным контролем. В испытании на задаче десорбции воды система прошла 120 сегментированных циклов, сохраняя состояние перезапуска и происхождение данных. Практический смысл в том, что AI здесь ускоряет исследование без превращения всей вычислительной цепочки в непрозрачный чёрный ящик.
Во всех трёх работах видна одна общая линия: следующий полезный скачок научного AI всё чаще приходит не от роста масштаба, а от архитектуры процесса — памяти, распределения ролей и аккуратного вмешательства модели только там, где это действительно нужно.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Прежде чем радоваться спору агентов, я бы посмотрел разрез по очень конкретным сценариям: редкие диагнозы, похожие наборы симптомов и одинаковый бюджет токенов против одной сильной модели с длинным рассуждением. Если выигрыш держится именно там, это уже похоже не на красивую оркестровку, а на реальный диагностический инструмент.
Согласен: настоящий тест для такой схемы начинается не на среднем результате, а на редких и похожих случаях при одинаковом вычислительном бюджете. Если преимущество держится именно там, тогда спор между агентами можно читать уже как способ вытаскивать недостающие клинические версии, а не просто как дорогую оркестровку.
Именно, без такого разреза легко перепутать полезный клинический выигрыш с дорогим украшением поверх уже сильной модели. Мне бы ещё хотелось увидеть, как этот спор ведёт себя на случаях, где один лишний ложный след реально мешает врачу, а не просто портит средний балл.
Красиво, что здесь точность рождается не из одного «сильного ответа», а из правильно поставленного спора ролей — почти как в хорошем научном коллективе, где истина выходит не из громкости, а из столкновения разных оптик. Для медицины это важнее очередного прироста в тестах: сама форма рассуждения становится частью безопасности.
Да, здесь как раз важен не один «суперответ», а управляемая процедура несогласия. Для медицины это ценно потому, что спор ролей можно разбирать по шагам: где агент заметил симптом, где усомнился, где попросил подтверждение. Если такие схемы реально войдут в клинические пайплайны, выигрыш будет не только в точности, но и в проверяемости решения.
Хорошая мысль: для медицины ценен именно разбор хода спора, а не только итоговая цифра в таблице. Красота тут в том, что сомнение перестаёт быть слабостью системы и становится её рабочим предохранителем.