AI в науке всё чаще оценивают не по красивым обещаниям, а по тому, насколько система выдерживает проверку на причинность, воспроизводимость и практическую полезность. В этой подборке пять работ: одна ставит под сомнение успокаивающую силу медицинских объяснений языковых моделей, другие показывают, как агентные и поисковые контуры уже начинают помогать в визуальной диагностике, белковых задачах и поиске новых материалов.

Медицинские объяснения языковых моделей могут быть красивыми, но не причинными

Авторы проверяют неприятную, но важную гипотезу: действительно ли видимая цепочка рассуждений помогает модели поставить диагноз, или она часто просто задним числом объясняет уже выбранный ответ. В работе по 14 моделям и четырём медицинским наборам вопросов сообщается высокий уровень «развязки» между объяснением и реальным решением: во многих клинически значимых случаях текст рассуждения можно испортить или убрать без заметной потери точности.

Если результат выдержит дальнейшую проверку, это серьёзный сигнал для медицинского AI: доверие нельзя строить только на убедительно звучащем объяснении. Для клиник и исследователей это означает, что проверять надо не красоту ответа, а то, какие именно механизмы реально влияют на итоговое решение.

Источник: статья

Агентный контур для медицинской визуализации показал конкурентные результаты сразу на четырёх открытых наборах

В этой работе агентная система не ограничивается одной узкой стадией, а проходит почти весь прикладной путь: читает литературу, предлагает код, запускает итерации и собирает полноценные базовые решения для задач медицинской визуализации. Авторы сообщают устойчивое улучшение качества на четырёх открытых бенчмарках и заметные места в таблицах результатов, включая шестые места на двух дорожках PUMA.

Смысл здесь не только в числах. Работа показывает, что AI начинает автоматизировать уже не игрушечные куски научного программирования, а цельные инженерные циклы, которые раньше требовали длинной ручной сборки из чтения статей, написания кода и повторных экспериментов.

Источник: статья

В белковом «соучёном» точность решает выбор рассуждения, а не цена федерации

Авторы этой работы смотрят на автономные белковые контуры как на измеряемую систему, а не как на абстрактную мечту. Они сравнивают влияние топологии федерации, выбранной политики, подсказок и самой модели и приходят к довольно жёсткому выводу: ключевую разницу в точности даёт именно способ рассуждения и выбор модели, тогда как цена федерации сама по себе оказывается не главным фактором.

Особенно интересен практический баланс: один из вариантов с обученной политикой даёт высокую точность при нулевой цене токенов и идеальной повторяемости. Это делает разговор об AI-«соучёных» куда взрослее: появляется не просто вау-эффект, а понятная шкала между качеством, стоимостью и воспроизводимостью.

Источник: статья

Генеративный поиск магнитных сплавов вывел более 300 кандидатов и 5 стабильных фаз

Здесь AI применяют к очень материальной задаче: поиску редкоземельных магнитных сплавов с хорошими свойствами. Авторы объединяют генеративную модель кристаллических структур, машинный предварительный отсев и физическую проверку методом теории функционала плотности. На выходе — более 300 низкоэнергетических магнитных кандидатов и 5 термодинамически стабильных фаз.

Это хороший пример того, где AI в материаловедении действительно ускоряет работу: не заменяет физику, а резко сужает огромный поисковый простор до набора вариантов, которые уже имеет смысл проверять серьёзными расчётами и, возможно, экспериментом.

Источник: статья

PIRAG-LM приблизил планирование синтеза к лабораторной практике с точностью 91,4 процента

Одна из самых прикладных проблем в AI для материалов — не просто предсказать интересный кристалл, а предложить правдоподобный путь его получения с нужными прекурсорами и условиями. В PIRAG-LM авторы собирают базу из 13 820 реальных записей о синтезе и строят контур, где поиск по этим данным помогает языковой модели рассуждать о термодинамике и доступности маршрута.

По сообщению авторов, точность предсказания метода синтеза достигает 91,4 процента против 72,1 процента у одной модели без такого поискового слоя. Это важный сдвиг от «материал на бумаге выглядит интересно» к вопросу, который действительно волнует лабораторию: можно ли его осмысленно попытаться получить.

Источник: статья