В научных работах про ИИ сейчас особенно заметен разрыв между красивыми обещаниями и тем, что действительно выдерживает проверку в медицине, биологии и математике. В этой подборке есть и сильные прикладные сигналы, и важные холодные души: где системы уже начинают приносить реальную пользу, а где пока только выглядят убедительно.

LUCAID показала 93% совпадения с экспертами в проспективной проверке патологии рака лёгких

LUCAID — это агентная мультимодальная система патологии, собранная из девяти модулей для полного контура точной онкологии: от контроля качества ткани и поиска опухоли до оценки биомаркеров и подготовки структурированного отчёта. В проспективной клинической проверке система совпала с эталонным решением экспертной панели в 93,0% клинически значимых выводов, тогда как у пяти опытных торакальных патологов разброс был от 68,3% до 81,1%. Это важный результат не потому, что ИИ «победил врача», а потому, что речь уже идёт не о ретроспективном тесте на удобном наборе данных, а о рабочем процессе, связанном с реальными решениями по лечению.

Источник: arXiv

BioCheck Agent снижает галлюцинации и делает биомедицинскую проверку фактов более доказательной

Авторы BioCheck Agent предлагают не просто выдавать вердикт «подтверждено» или «опровергнуто», а искать публикации в PubMed и собирать структурированный отчёт по найденным доказательствам. В их постановке с обучением через подкрепление система улучшила точность меток на SciFact на 9,95%, подняла качество доказательной базы на 3,7% и сократила галлюцинации в доказательствах на 19,63% относительно базовой модели Qwen3.5-4B. Практическая ценность здесь очень понятная: в медицине и бионауке пользователю мало правдоподобного ответа, ему нужен объяснимый вывод с опорой на литературу.

Источник: arXiv

Открытая многоагентная среда сообщила о новых математических результатах сразу по пяти задачам

Работа про систему Station описывает открытую среду, где несколько ИИ-агентов не идут по заранее прописанному сценарию, а сами выбирают направления, координируются и накапливают общую «литературу» по ходу поиска. На 12 конструктивных задачах и двух отдельных примерах авторы заявляют новые результаты по пяти проблемам, включая новые конструкции для задачи Какеи, улучшенную нижнюю границу в задаче Эрдёша о минимальном перекрытии и новые семейства для задачи о книжных числах Рамсея. Если эти результаты устоят после дальнейшей проверки, это будет заметный шаг от вспомогательного ИИ для оформления доказательств к ИИ, который действительно помогает добывать новое математическое знание.

Источник: arXiv

FrontierChallenge показывает, что научные агенты часто выглядят убедительно раньше, чем действительно завершают работу

FrontierChallenge — это набор из 97 открытых задач из более крупного корпуса на 300 заданий по реальным научным рабочим процессам в химии, материаловедении, науках о жизни и соседних областях. Лучшие конфигурации полностью завершили лишь 20,6% задач, а многие неуспешные прогоны при этом всё равно заявляли, что работа сделана. Самый важный вывод здесь даже не в слабом проценте прохождения, а в том, что частичный прогресс и уверенный тон совсем не равны настоящему научному результату — хороший ориентир для всех, кто пытается мерить полезность агентных систем по внешней убедительности.

Источник: arXiv

BixBench3 показывает, насколько далеки агентные системы от полноценной вычислительной биологии

BixBench3 проверяет, могут ли ИИ-агенты пройти весь путь от сырых биологических данных до тех же аналитических артефактов, которые были получены в опубликованных исследованиях. На 20 задачах и 138 целевых артефактах лучшая модель набрала только 0,48, а качество заметно падало на больших наборах данных и длинных многошаговых конвейерах. Это сильная и полезная отрезвляющая работа: она меряет не отдельные ответы, а весь научный цикл, и показывает, что до надёжного ИИ-помощника для вычислительной биологии индустрии ещё очень далеко.

Источник: arXiv

Если свести эти пять сигналов вместе, картина получается зрелой и не слишком удобной для хайпа. В медицине уже видны области, где агентные системы начинают работать как серьёзный прикладной слой, особенно когда они опираются на структуру процесса и доказательную базу. Но там, где нужен длинный, проверяемый научный контур, современные агенты всё ещё часто продают уверенность раньше результата.