Сегодняшний выпуск хорошо показывает, как меняется AI-наука: прорывы всё чаще выглядят не как «модель решила всё», а как точное выявление узких мест, добавление проверок и создание общих стандартов. Ниже — пять новых работ, которые двигают вперёд математику, медицину, материаловедение, вычислительную биологию и эпидемиологию.

FormalTCS shows autoformalization is the main bottleneck for AI doing frontier theoretical computer science

FormalTCS собирает экспертно проверенный набор задач из свежих работ STOC, FOCS, SODA и COLT и проверяет, насколько большие языковые модели способны пройти полный цикл теоретико-информатического исследования с Lean-доказательствами в контуре. Главный вывод очень показателен: современные модели чаще ломаются не на уже формализованном доказательстве, а на предыдущем шаге — переводе естественного математического утверждения в точную формальную теорему.

Почему это важно: работа не просто говорит, что «модели пока слабы», а указывает конкретное место, где нужна следующая волна прогресса. Если AI и станет реальным помощником в исследовательской математике и теоретической информатике, то прорыв должен произойти именно в автоматической формализации, а не только в переборе доказательств.

EVADE makes medical vision-language diagnosis safer by verifying across image views and abstaining when uncertain

EVADE предлагает практичную идею для медицинских мультимодальных моделей: спрашивать одну и ту же модель о полном изображении и о диагностически важном увеличенном фрагменте, а затем доверять ответу только тогда, когда обе точки зрения согласуются. Если согласия нет, система воздерживается от вывода.

Почему это важно: в медицине проблема не только в средней точности, но и в опасной самоуверенности модели. Подход EVADE интересен тем, что не требует переобучения базовой модели, а добавляет защитный слой поверх уже существующей системы. Это делает идею ближе к реальному внедрению в радиологии и патологии, где осторожное воздержание часто лучше уверенной ошибки.

LLMs show they can act as materials-discovery acquisition policies, but not replace classical optimization yet

Авторы этой работы проверяют, могут ли open-weight LLM выбирать, какой материал стоит проверять следующим в дорогостоящем цикле поиска новых веществ. Результат получился одновременно обнадёживающим и отрезвляющим: модели уверенно лучше случайного выбора и иногда дотягиваются до классических методов на базе гауссовских процессов, но поведение сильно зависит от конкретной задачи и настройки.

Почему это важно: это один из тех редких случаев, когда LLM честно сравнивают не с человеком вообще, а с сильными специализированными алгоритмами. Вывод полезный: языковые модели уже могут быть недорогой эвристикой в лабораторных циклах поиска, но пока рано считать их универсальной заменой классической оптимизации в материаловедении.

PEtab SciML proposes a common format for hybrid biology models that mix equations with machine learning

PEtab SciML вводит общий формат для обучения гибридных научных моделей, которые сочетают механистические системы дифференциальных уравнений и обучаемые компоненты машинного обучения. На практике такие конструкции становятся всё важнее в биологии и медицине, но сейчас воспроизводимость страдает из-за слишком разных стеков, настроек и соглашений между лабораториями.

Почему это важно: иногда самый большой вклад в науку — не новая модель, а общий язык для сравнения результатов. Если PEtab SciML приживётся, исследователям будет проще переносить эксперименты между Python, JAX и Julia, а главное — честно сопоставлять гибридные биологические модели друг с другом, а не только внутри одной лаборатории.

GENIE brings near-real-time epidemic forecasting to high-resolution local outbreak maps

GENIE предлагает систему для быстрого прогноза респираторных вспышек на детальном географическом уровне без полной цены агентных эпидемических симуляций. Идея в том, чтобы совместить общие биологические закономерности с локальными факторами передачи инфекции и получить полезный прогноз быстрее, чем это обычно удаётся тяжёлым симуляционным подходам.

Почему это важно: при вспышках чиновникам и врачам нужны не только общенациональные кривые, но и локальные оценки по конкретным районам. Если такие модели окажутся устойчивыми на практике, они могут сделать эпидемиологическое реагирование заметно более точным и оперативным — особенно там, где счёт идёт на дни.