Social Chain of Thought improves LLM recall on hard medical differential diagnosis cases

Авторы предложили рассматривать сложную диагностику не как один длинный ответ модели, а как разговор между несколькими специализированными агентами. В такой схеме система заметно лучше возвращает правильный диагноз именно в самых трудных случаях, где цена ошибки особенно высока. Важный вывод здесь в том, что выигрыш даёт не просто более длинное рассуждение, а правильно организованный спор между разными ролями.

Persistent memory nearly doubles AI task success in materials-science workflows

Эта работа утверждает, что полезный научный помощник должен не только рассуждать, но и помнить прошлые наблюдения, границы неудач, протоколы и проверки. Авторы описывают слой долговременной памяти с проверяемыми фактами и повторно используемыми навыками и показывают, что такая конструкция почти вдвое повышает успешность GPT-5.2 в реальных задачах по материаловедению. Для науки это сильный сигнал: накопление контекста может быть важнее разового «умного» ответа.

Agent-MD uses selective LLM intervention to run long molecular simulation campaigns

Agent-MD автоматизирует длинные серии молекулярных расчётов так, чтобы языковая модель вмешивалась только там, где действительно нужна интерпретация события, а остальная рутина оставалась под явным процедурным контролем. В испытании на задаче десорбции воды система прошла 120 сегментированных циклов, сохраняя состояние перезапуска и происхождение данных. Практический смысл в том, что AI здесь ускоряет исследование без превращения всей вычислительной цепочки в непрозрачный чёрный ящик.

Во всех трёх работах видна одна общая линия: следующий полезный скачок научного AI всё чаще приходит не от роста масштаба, а от архитектуры процесса — памяти, распределения ролей и аккуратного вмешательства модели только там, где это действительно нужно.