В этой подборке особенно заметен один общий сдвиг: ИИ в науке всё чаще оценивают не по красоте отдельных ответов, а по тому, проходит ли система проверку на воспроизводимость, качество суждений и полезность в реальном исследовательском цикле. Одни работы пытаются сделать научных агентов надёжнее, другие уже показывают примеры, где ИИ помогает довести дело до результата в материалах, физике, биологии и разработке лекарств.

Gemini и Co-Scientist показали замкнутый цикл научной работы с реальными результатами

Авторы описывают расширение системы Co-Scientist на базе Gemini от генерации идей к полному научному циклу с реальными экспериментами. По их словам, система помогла подбирать пути синтеза новых материалов этого семейства, быстро настраивать режимы роста для однослойных полупроводников, предсказывать поведение бактериального роения по скудным изображениям и даже найти архитектуру для клинических задач, которая обошла шесть сильных моделей на сложных медицинских проверках.

Почему это важно: если такие результаты подтверждаются, речь уже не о помощнике для заметок, а о системе, которая начинает влиять на настоящую лабораторную и прикладную научную работу.

Источник: arXiv

AstraZeneca показала, как проверять качество научного агента для разработки лекарств

Исследователи из AstraZeneca предлагают схему оценки для ChatInvent — агентной системы для поиска идей в разработке лекарств — и отдельно изучают, какая модель лучше всего совпадает с суждениями экспертов-людей. После донастройки лучшего автоматического судьи на небольшой размеченной людьми выборке согласие с мнением большинства выросло с 0,80 до 0,86 по таким критериям, как полнота, уместность и соблюдение рамок задачи.

Почему это важно: по мере роста возможностей научных агентов главным узким местом становится уже не генерация идей сама по себе, а проверка того, можно ли вообще доверять качеству их выводов.

Источник: arXiv

AutoResearchEval разобрал, где именно ломаются научные агенты на передовых задачах

Авторы собрали набор из 100 реальных исследовательских задач в семи научных областях и прогнали через него восемь агентных конфигураций. Главный результат не в том, что какая-то система победила всех, а в том, что работа даёт карту из 45 повторяющихся типов сбоев — от неверной оценки собственных выводов до слабой проверки связи между собранными данными и итоговым утверждением.

Почему это важно: поле получает не очередную витрину возможностей, а более честный инструмент диагностики того, почему ИИ-учёные до сих пор ошибаются и где именно им не хватает самопроверки.

Источник: arXiv

HypoForge пытается сделать ИИ-учёного системой, которая учится на прошлых запусках

HypoForge описан как многоагентная система для выдвижения и проверки научных гипотез, которая не просто повторяет один и тот же шаблон, а пытается накапливать полезные научные навыки из прошлого опыта. Авторы разделяют этапы порождения гипотез и их проверки, улучшают первый через состязательную критику, а второй — через обратную связь от исполнения и сравнение с истинным результатом.

Почему это важно: многие сегодняшние ИИ-системы для науки всё ещё похожи на одноразовые оркестраторы. Здесь ставка сделана на постепенное обучение самой научной процедуры, а не только на очередной удачный прогон.

Источник: arXiv

ИИ-система подсказала путь к новым ограничениям причинности в физике рассеяния

Авторы этой теоретической работы пишут, что исходное направление поиска автономно исследовала система Qiushi Engine, а затем люди проверили и развили результат. В итоге предложен способ записывать правила причинности прямо через обычные матрицы рассеяния, связывая абстрактные ограничения с измеримыми величинами вроде потерь сигнала и компромисса между задержкой и полосой частот.

Почему это важно: это редкий и наглядный пример, где ИИ помог не оформить уже найденную идею, а нащупать маршрут к реальному результату в математической физике.

Источник: arXiv

Во всех пяти работах видно одно и то же напряжение: возможностей у ИИ в науке становится больше, но вместе с ними резко растёт цена ошибки. Поэтому самые интересные сигналы сейчас идут не только от громких заявлений о новых открытиях, но и от тех работ, где авторы пытаются доказать, что систему можно проверить, воспроизвести и встроить в настоящий исследовательский процесс.