OpenDiscoveryTrace: полные следы работы ИИ-учёных

OpenDiscoveryTrace собирает 558 полных траекторий научных ИИ-агентов по 124 задачам: поиск лекарств, материаловедение, геномика и анализ литературы. Ценность здесь в том, что оценивается не только финальный ответ, а весь ход работы: рассуждения, вызовы инструментов, наблюдения, ошибки и уверенность. Это важно для аудита научного ИИ: две модели могут показывать похожую долю успешных задач, но ошибаться совершенно по-разному.

LATS: поиск редких ценных кандидатов через адаптивное дерево

LATS предлагает способ исследовать области, где самые полезные научные кандидаты могут находиться в маловероятных хвостах распределения. Метод сочетает тяжёлые хвосты для смелого поиска и дерево с обратной передачей ценности после обратной связи. На задачах, включая материаловедческие проверки, это помогает находить редкие перспективные варианты эффективнее базовых методов и при этом сохранять разнообразие кандидатов.

CoReFuse-Med: медицинская сегментация, устойчивая к испорченным данным

CoReFuse-Med разбирает практическую проблему мультимодальной медицинской сегментации: плохой канал данных может не просто быть бесполезным, а активно портить прогноз. Подход подавляет передачу повреждённых признаков и заново взвешивает вклад разных модальностей. В экспериментах на EPVS, BraTS и WMH это улучшает устойчивость, а главный урок прост: клинический ИИ должен работать не только на идеально согласованных снимках.

ABLE: проверка того, как языковые агенты используют инструменты белкового дизайна

ABLE оценивает, насколько хорошо языковые модели как агенты применяют биологические ИИ-модели вроде ProteinMPNN и AlphaFold3. Задачи включают поиск структур, генерацию последовательностей и проверку результатов. Авторы сравнили 15 передовых моделей и увидели большой разброс: некоторые отказываются выполнять все задания, а лучшие всё равно заметно различаются по планированию и использованию инструментов. Это полезно и для оценки возможностей белкового дизайна, и для биобезопасности.

MLIP Detective: поиск провалов материаловедческих моделей за пределами обычных тестов

MLIP Detective — агентная схема для проверки машинно-обученных межатомных потенциалов. Она берёт результаты тестов, формулирует физически осмысленные гипотезы о возможных сбоях, быстро просеивает их симуляциями и отдаёт самые подозрительные случаи на экспертную проверку. В работе нашли систематическую аномалию в MACE-MPA-0 для некоторых систем с адсорбатами, содержащими O или F, что хорошо показывает: высокий общий балл ещё не гарантирует научную надёжность.

SPARC: совместный цикл человека и агента в сканирующей микроскопии

Работа описывает SPARC — совместный цикл человека и ИИ-агента для исследовательской сканирующей зондовой микроскопии. Его применили к управлению направлением ферроэлектрических супердоменов в плёнке PbZr0.2Ti0.8O3. Материаловедческий результат важен сам по себе, но ещё интереснее рабочий шаблон: агент использовал прошлые измерения, хранил память об ошибках и помогал планировать физические проверки перед управлением прибором.

uFlowCSP: быстрые кандидаты кристаллических структур по формуле

uFlowCSP генерирует полные кандидаты кристаллических структур за один-пять проходов нейросети. Это резко меньше, чем десятки или тысячи проходов, часто нужные диффузионным и потоковым методам. На MP-20 модель достигает уровня сильных базовых решений или превосходит их при меньшем числе вычислений. Для материаловедения это означает более дешёвый массовый отбор структур по одной химической формуле.

«Сходящаяся лаборатория»: ИИ-рассуждение, автономные опыты и квантовые вычисления в химии

Комментарий сообщества TPC26 рассматривает химию и материаловедение как область, где сразу созревают несколько линий: ИИ-рассуждение, автономные агенты, самоуправляемые лаборатории, высокопроизводительные вычисления и квантовые процессоры. Это не отдельная техническая новинка, а полезная карта сдвига инфраструктуры: научное открытие всё чаще строится как связка моделей, приборов, вычислений и проверки, а не как один изолированный алгоритм.