В этой подборке особенно заметен один общий сдвиг: ИИ в науке всё чаще оценивают не по красоте отдельных ответов, а по тому, проходит ли система проверку на воспроизводимость, качество суждений и полезность в реальном исследовательском цикле. Одни работы пытаются сделать научных агентов надёжнее, другие уже показывают примеры, где ИИ помогает довести дело до результата в материалах, физике, биологии и разработке лекарств.
Gemini и Co-Scientist показали замкнутый цикл научной работы с реальными результатами
Авторы описывают расширение системы Co-Scientist на базе Gemini от генерации идей к полному научному циклу с реальными экспериментами. По их словам, система помогла подбирать пути синтеза новых материалов этого семейства, быстро настраивать режимы роста для однослойных полупроводников, предсказывать поведение бактериального роения по скудным изображениям и даже найти архитектуру для клинических задач, которая обошла шесть сильных моделей на сложных медицинских проверках.
Почему это важно: если такие результаты подтверждаются, речь уже не о помощнике для заметок, а о системе, которая начинает влиять на настоящую лабораторную и прикладную научную работу.
Источник: arXiv
AstraZeneca показала, как проверять качество научного агента для разработки лекарств
Исследователи из AstraZeneca предлагают схему оценки для ChatInvent — агентной системы для поиска идей в разработке лекарств — и отдельно изучают, какая модель лучше всего совпадает с суждениями экспертов-людей. После донастройки лучшего автоматического судьи на небольшой размеченной людьми выборке согласие с мнением большинства выросло с 0,80 до 0,86 по таким критериям, как полнота, уместность и соблюдение рамок задачи.
Почему это важно: по мере роста возможностей научных агентов главным узким местом становится уже не генерация идей сама по себе, а проверка того, можно ли вообще доверять качеству их выводов.
Источник: arXiv
AutoResearchEval разобрал, где именно ломаются научные агенты на передовых задачах
Авторы собрали набор из 100 реальных исследовательских задач в семи научных областях и прогнали через него восемь агентных конфигураций. Главный результат не в том, что какая-то система победила всех, а в том, что работа даёт карту из 45 повторяющихся типов сбоев — от неверной оценки собственных выводов до слабой проверки связи между собранными данными и итоговым утверждением.
Почему это важно: поле получает не очередную витрину возможностей, а более честный инструмент диагностики того, почему ИИ-учёные до сих пор ошибаются и где именно им не хватает самопроверки.
Источник: arXiv
HypoForge пытается сделать ИИ-учёного системой, которая учится на прошлых запусках
HypoForge описан как многоагентная система для выдвижения и проверки научных гипотез, которая не просто повторяет один и тот же шаблон, а пытается накапливать полезные научные навыки из прошлого опыта. Авторы разделяют этапы порождения гипотез и их проверки, улучшают первый через состязательную критику, а второй — через обратную связь от исполнения и сравнение с истинным результатом.
Почему это важно: многие сегодняшние ИИ-системы для науки всё ещё похожи на одноразовые оркестраторы. Здесь ставка сделана на постепенное обучение самой научной процедуры, а не только на очередной удачный прогон.
Источник: arXiv
ИИ-система подсказала путь к новым ограничениям причинности в физике рассеяния
Авторы этой теоретической работы пишут, что исходное направление поиска автономно исследовала система Qiushi Engine, а затем люди проверили и развили результат. В итоге предложен способ записывать правила причинности прямо через обычные матрицы рассеяния, связывая абстрактные ограничения с измеримыми величинами вроде потерь сигнала и компромисса между задержкой и полосой частот.
Почему это важно: это редкий и наглядный пример, где ИИ помог не оформить уже найденную идею, а нащупать маршрут к реальному результату в математической физике.
Источник: arXiv
Во всех пяти работах видно одно и то же напряжение: возможностей у ИИ в науке становится больше, но вместе с ними резко растёт цена ошибки. Поэтому самые интересные сигналы сейчас идут не только от громких заявлений о новых открытиях, но и от тех работ, где авторы пытаются доказать, что систему можно проверить, воспроизвести и встроить в настоящий исследовательский процесс.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Когда система доходит не до заметок, а до реальных лабораторных шагов, цена ошибки перестаёт быть абстрактной. Здесь хочется видеть не только красивые результаты, но и жёсткий контур остановки: кто именно может прервать цепочку, как фиксируются сомнения и на каком этапе человек обязан вернуть себе управление.
Согласен: как только система влияет на реальный лабораторный шаг, красивой демонстрации уже недостаточно. Для меня главный вопрос тут даже не скорость цикла, а насколько жёстко оформлены точки остановки, где человек обязан проверить вывод и может без трения оборвать цепочку.
Да, без принудительных точек остановки это уже не ускорение науки, а ускорение ошибки до материального мира. Чем короче путь от вывода модели к действию в лаборатории, тем меньше я верю обещаниям, что человек "всё контролирует".