Главная тема этой подборки — переход от красивых ответов к проверяемым научным инструментам. В медицине это означает учет конкретных клинических ошибок, в материалах — поиск составов с несколькими конфликтующими свойствами, а в научных агентах — явные гипотезы и эксперименты вместо свободного текста.

RadMatch: проверяемая оценка отчетов по медицинским снимкам

RadMatch предлагает оценивать ИИ-отчеты рентгенологов не одним общим баллом, а сравнением на уровне отдельных находок. Система считает клинически значимые ошибки, отдельно отмечает пропущенные и выдуманные признаки и, по заявлению авторов, заметно лучше совпадает с оценками врачей на экспертных наборах. Практический смысл большой: больницам и разработчикам нужны не красивые средние показатели, а аудит, который показывает, где именно модель опасно ошиблась.

AlphaRAD: классификация и привязка к областям на снимках грудной клетки

AlphaRAD использует структурированные медицинские понятия, извлеченные из отчетов с помощью большой языковой модели, чтобы уменьшить шум в обучении. Затем отдельный модуль помогает связывать предсказания с областями изображения. Авторы заявляют сильные результаты на 16 проверках классификации снимков грудной клетки, а также улучшения в задачах локализации и выделения областей. Для клинического ИИ это важно потому, что врачу мало получить метку болезни: нужно видеть, на чем основан вывод.

Глубокое обучение для проектирования магнитных сплавов на основе железа

Эта работа применяет порождающую многозадачную модель к сплавам на основе железа. Цель сложная: одновременно получить высокую магнитную индукцию насыщения, низкую коэрцитивную силу и хорошую способность образовывать аморфную структуру. Такие свойства часто конфликтуют, поэтому ручной поиск состава быстро становится дорогим. Авторы сравнивают предсказания с недавними сплавами и выделяют перспективные диапазоны состава — хороший пример того, как ИИ помогает сужать огромные пространства материалов, а не просто ранжировать уже известные варианты.

ProtLingo: более экономная языковая модель для белков

ProtLingo добавляет к модели белковых последовательностей локальную память и разреженную маршрутизацию экспертов. Идея в том, чтобы лучше улавливать, как отдельные мутации меняют функцию белка, без постоянного роста плотной модели. В задачах прогноза пригодности белков, проверках FLIP и предсказании контактов система показывает конкурентные результаты. Для белковой инженерии это ценно: самые важные различия часто скрыты в небольших изменениях последовательности, а стоимость больших моделей быстро становится ограничением.

Как языковые модели встраивают внешние доказательства в научные ответы

Исследование проверяет более 10 млн попыток на 12 языковых моделях и восьми научных областях, включая квантовую механику, физику, генетику и молекулярную биологию. Самый тревожный вывод: модели могут включать неверные варианты ответа даже тогда, когда внутренняя проверка уже выявила проблему. Для научных агентов это прямое предупреждение. Поиск источников и проверка фактов сами по себе не гарантируют надежности, если модель затем все равно смешивает правильные и неправильные свидетельства в одном ответе.

EvoSCM: научный агент с явными причинными моделями

EvoSCM описывает агента, который хранит не расплывчатые текстовые гипотезы, а явные структурные причинные модели. Он поддерживает несколько конкурирующих объяснений, предлагает вмешательства для их опровержения, обновляет модели после экспериментов и показывает улучшения на DiscoverPhysics. Это важный сдвиг для ИИ в науке: система должна не просто генерировать правдоподобные объяснения, а вести учет проверяемых причинных предположений и менять их после новых данных.

Общий вывод: самые полезные научные модели сейчас движутся к проверяемости. Хорошая система уже не может ограничиться ответом или рейтингом — ей приходится показывать ошибку, область изображения, состав материала, мутацию белка, источник доказательства или причинную гипотезу, которую можно атаковать экспериментом.