В этом выпуске главное направление — не просто помощники для пересказа статей, а системы, которые пытаются сделать научную работу проверяемой: восстановить формулы, связать выводы с доказательствами, превратить код в учебную среду и открыть врачам быстрый доступ к редким клиническим случаям.

Rosetta извлекает модели первого принципа из научных статей

Rosetta — многоагентный конвейер на базе языковых моделей, который читает научные статьи и строит по ним математические спецификации, исполняемые модели и понятные объяснения. Важно, что система нацелена не на красивый пересказ, а на восстановление того, какие допущения, формулы и связи между величинами стоят за выводами авторов.

Авторы проверяли Rosetta на знаковых работах, случайных статьях по архитектуре систем и самооценке авторов активных исследований. По их отчёту, в 10 из 12 экспертно оценённых статей не нашли серьёзных выдумок, а в текущих рукописях система даже помогала выявлять скрытые допущения, менять формулировки и добавлять эксперименты. Если результат подтвердится шире, это может стать полезным мостом между текстом статьи и воспроизводимой моделью.

Система для медицинских случаев структурировала 52 949 отчётов

Вторая работа описывает систему поиска по открытым клиническим описаниям: она извлекает краткие сведения о пациентах, медицинские изображения и биомедицинские сущности из 52 949 отчётов, опубликованных с 2000 по 2021 год. Такие отчёты особенно важны для редких болезней, необычных проявлений и первых сигналов о новых методах лечения.

Практическая ценность здесь в том, что врачам часто нужно не общее знание из учебника, а похожий редкий случай с деталями. Обычный поиск по словам плохо справляется с такой задачей, потому что симптомы, изображения и диагнозы могут быть описаны разными способами. Структурирование через медицинские онтологии делает этот слой знаний заметно ближе к рабочему инструменту.

BioPhys-Bridge проверяет, умеют ли модели связывать биологию, физику и доказательства

BioPhys-Bridge предлагает 500 случаев и 1 517 задач для проверки рассуждений по биофизическим статьям. Модели должны не просто отвечать на вопрос, а связывать исходные фрагменты, численные значения, уравнения, допущения и биологические механизмы.

Это важный поворот в оценке научного AI. В междисциплинарных задачах опаснее всего не грубая ошибка, а уверенное объяснение, которое звучит правдоподобно, но плохо связано с исходными доказательствами. Первые результаты показывают, что модели всё ещё слабо справляются с точной привязкой к доказательствам, поэтому такой набор задач полезен как измеритель реальной научной аккуратности.

ScienceIDE превращает научные репозитории в среды обучения для исследовательских агентов

ScienceIDE предлагает инфраструктуру, которая берёт научные кодовые базы и превращает их в исполняемые среды для обучения агентов. Внутри есть экспертные случаи, критерии приёмки, генерация задач, запуск кода и проверка результата.

Смысл работы в том, что научные агенты нельзя учить только на статичных вопросах и ответах. Настоящее исследование часто требует запустить код, починить ошибку, проверить гипотезу и понять, почему результат не сошёлся. Авторы обучили модели на проверенных следах таких взаимодействий и сообщили об улучшениях на отложенных задачах исправления научного кода. Это делает научное программное обеспечение не только объектом автоматизации, но и учебной средой для будущих исследовательских агентов.

Общая линия этих четырёх работ простая: AI в науке взрослеет там, где его заставляют показывать не только ответ, но и путь к нему — допущения, исходные данные, код, доказательства и проверку результата.