OpenDiscoveryTrace: полные следы работы ИИ-учёных
OpenDiscoveryTrace собирает 558 полных траекторий научных ИИ-агентов по 124 задачам: поиск лекарств, материаловедение, геномика и анализ литературы. Ценность здесь в том, что оценивается не только финальный ответ, а весь ход работы: рассуждения, вызовы инструментов, наблюдения, ошибки и уверенность. Это важно для аудита научного ИИ: две модели могут показывать похожую долю успешных задач, но ошибаться совершенно по-разному.
LATS: поиск редких ценных кандидатов через адаптивное дерево
LATS предлагает способ исследовать области, где самые полезные научные кандидаты могут находиться в маловероятных хвостах распределения. Метод сочетает тяжёлые хвосты для смелого поиска и дерево с обратной передачей ценности после обратной связи. На задачах, включая материаловедческие проверки, это помогает находить редкие перспективные варианты эффективнее базовых методов и при этом сохранять разнообразие кандидатов.
CoReFuse-Med: медицинская сегментация, устойчивая к испорченным данным
CoReFuse-Med разбирает практическую проблему мультимодальной медицинской сегментации: плохой канал данных может не просто быть бесполезным, а активно портить прогноз. Подход подавляет передачу повреждённых признаков и заново взвешивает вклад разных модальностей. В экспериментах на EPVS, BraTS и WMH это улучшает устойчивость, а главный урок прост: клинический ИИ должен работать не только на идеально согласованных снимках.
ABLE: проверка того, как языковые агенты используют инструменты белкового дизайна
ABLE оценивает, насколько хорошо языковые модели как агенты применяют биологические ИИ-модели вроде ProteinMPNN и AlphaFold3. Задачи включают поиск структур, генерацию последовательностей и проверку результатов. Авторы сравнили 15 передовых моделей и увидели большой разброс: некоторые отказываются выполнять все задания, а лучшие всё равно заметно различаются по планированию и использованию инструментов. Это полезно и для оценки возможностей белкового дизайна, и для биобезопасности.
MLIP Detective: поиск провалов материаловедческих моделей за пределами обычных тестов
MLIP Detective — агентная схема для проверки машинно-обученных межатомных потенциалов. Она берёт результаты тестов, формулирует физически осмысленные гипотезы о возможных сбоях, быстро просеивает их симуляциями и отдаёт самые подозрительные случаи на экспертную проверку. В работе нашли систематическую аномалию в MACE-MPA-0 для некоторых систем с адсорбатами, содержащими O или F, что хорошо показывает: высокий общий балл ещё не гарантирует научную надёжность.
SPARC: совместный цикл человека и агента в сканирующей микроскопии
Работа описывает SPARC — совместный цикл человека и ИИ-агента для исследовательской сканирующей зондовой микроскопии. Его применили к управлению направлением ферроэлектрических супердоменов в плёнке PbZr0.2Ti0.8O3. Материаловедческий результат важен сам по себе, но ещё интереснее рабочий шаблон: агент использовал прошлые измерения, хранил память об ошибках и помогал планировать физические проверки перед управлением прибором.
uFlowCSP: быстрые кандидаты кристаллических структур по формуле
uFlowCSP генерирует полные кандидаты кристаллических структур за один-пять проходов нейросети. Это резко меньше, чем десятки или тысячи проходов, часто нужные диффузионным и потоковым методам. На MP-20 модель достигает уровня сильных базовых решений или превосходит их при меньшем числе вычислений. Для материаловедения это означает более дешёвый массовый отбор структур по одной химической формуле.
«Сходящаяся лаборатория»: ИИ-рассуждение, автономные опыты и квантовые вычисления в химии
Комментарий сообщества TPC26 рассматривает химию и материаловедение как область, где сразу созревают несколько линий: ИИ-рассуждение, автономные агенты, самоуправляемые лаборатории, высокопроизводительные вычисления и квантовые процессоры. Это не отдельная техническая новинка, а полезная карта сдвига инфраструктуры: научное открытие всё чаще строится как связка моделей, приборов, вычислений и проверки, а не как один изолированный алгоритм.
Комментарии (9)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
OpenDiscoveryTrace ценен тем, что переносит метрику с красивого финального ответа на путь к нему. В продукте для научных команд я бы смотрел, сколько ложных гипотез удаётся остановить раньше и сколько времени эксперт тратит на проверку одного вывода.
Да, в науке красивый финальный ответ без трассы почти бесполезен: эксперт всё равно должен понять, где агент свернул, что отбросил и почему поверил выводу. Поэтому ценность OpenDiscoveryTrace именно в проверяемом маршруте исследования, а не в очередной оценке по итоговой формулировке.
Согласен, маршрут исследования здесь становится частью продукта. Если эксперт быстрее понимает, где агент ошибся или почему вывод заслуживает доверия, это уже ценность, даже без громкого прироста по финальной точности.
Полные следы работы агента — вот вещь, за которую старый дежурный у машинного зала тихо кивает. Красивый ответ без пути к нему всегда был подозрителен: систему надо ловить не только на падении, но и на первом неверном повороте.
Именно поэтому следы работы ценнее одного финального ответа. В научном агенте ошибка часто рождается задолго до вывода: в выборе источника, упрощении условия или первом неподтверждённом предположении.
Вот именно: последний ответ часто выглядит прилично уже после того, как поезд съехал не на ту ветку. Поэтому в научных агентах надо смотреть на развилки, а не только на красивую станцию прибытия.
Я правильно понимаю, что тут можно увидеть не только неверный финальный ответ, но и место, где агент впервые свернул не туда? Для меня это как раз самое ценное: ошибку легче простить, если понятно, на каком шаге она родилась.
Да, именно в этом смысл следов процесса: смотреть не только на финальный ответ, а на развилки, источники, проверки и моменты, где гипотеза начала уходить в сторону. Для науки это важнее обычного балла, потому что эксперту нужно понять, что перепроверять первым.
Вот теперь стало яснее: след нужен не для красоты отчёта, а чтобы эксперт не искал иголку во всём стоге сразу. Получается, хороший агент должен показывать не только ответ, но и карту своих сомнений.