В AI для науки сегодня заметны не только громкие обещания, но и попытки закрыть реальные узкие места: как переносить формальные методы в современную математику, как проверять научное рассуждение моделей по данным, как не терять физический смысл в поиске материалов и как тратить вычисления в медицине только там, где это действительно нужно. Ниже четыре свежие работы, которые хорошо показывают этот сдвиг.

1. Lean 4 и библиотека банаховых решеток для исследовательской математики

Авторы описывают новую библиотеку Lean 4 для банаховых решеток и подчеркивают, что аккуратная работа человека вместе с большими языковыми моделями сделала такой объем формализации практически достижимым. Важная деталь в том, что речь идет не о слепой автоформализации, а о процессе, где исследователь сохраняет понимание доказательств и кода. Это сильный сигнал для AI в математике: полезность здесь не в эффектной демонстрации одного теоремного трюка, а в создании долговечной инфраструктуры, на которой можно строить следующую исследовательскую работу.

2. SEE проверил, насколько мультимодальные модели умеют рассуждать по научным данным

Бенчмарк SEE собран из экспертных вопросов по химии, биологии и материалам и проверяет не пересказ учебника, а выводы, строго ограниченные представленными доказательствами. Авторы прогнали 19 мультимодальных моделей и показали, что даже лучший результат остается на уровне 48,7 процента точности, а с инструментами поднимается лишь до 52,7 процента. Для AI в науке это неприятный, но полезный ориентир: системы по-прежнему слабо справляются с тем видом доказательного рассуждения, который нужен в настоящей лабораторной практике.

3. Подход к AI для материаловедения требует физического смысла, а не одного совпадения по шаблону

Авторы этой обзорной работы предлагают строить AI для материаловедения вокруг физических ограничений, проверок и осмысленных признаков, а не вокруг одной лишь статистической подгонки. В центре внимания катализ, твердотельные батареи и хранение водорода — области, где модель может показать красивый прогноз и все равно ошибиться при столкновении с термодинамикой и кинетикой. Ценность статьи в том, что она формулирует практическую программу: если AI должен помогать открывать материалы, ему нужно не просто угадывать кандидатов, а работать в границах физической реальности.

4. SecondOpinion подключает более тяжелую медицинскую модель только к сложным случаям

В работе SecondOpinion предложена двухступенчатая схема для анализа медицинских изображений: быстрый основной модуль смотрит все случаи, а более тяжелая анатомически ориентированная проверка включается только тогда, когда система ожидает возможную ошибку. На рентгене грудной клетки и данных по переломам таза подход вышел на уровень лучших прежних результатов или выше, при этом для рентгена дополнительная проверка понадобилась лишь примерно в 9,23 процента случаев. Это важный шаг к более клинической логике работы AI: не тратить одинаково много ресурсов на все снимки, а усиливать анализ там, где случай действительно трудный.

Общий вывод у этой четверки довольно трезвый. Самые интересные подвижки в AI для науки сейчас возникают там, где исследователи не пытаются заменить научный процесс одной большой моделью, а точечно усиливают формализацию, проверку доказательств, соблюдение физических ограничений и распределение вычислительного внимания.