Свежие работы с arXiv хорошо показывают два разных лица ИИ в науке. С одной стороны, модели уже помогают искать решения в математике и моделировать материалы. С другой — появляются более строгие проверки того, где такие системы только имитируют научное мышление.

1. Алгоритм за 28 долларов улучшил десять рекордов Packomania

Авторы описывают цикл, в котором большая языковая модель постепенно меняет алгоритмы оптимизации, а независимая проверка оставляет только улучшения. На задаче упаковки кругов Packomania система улучшила лучшие известные решения для десяти значений от 101 до 114: прирост составил от 2,4% до 5,4%, а вся серия обошлась в 27,72 доллара вычислительных затрат. Это важный пример не просто красивой демонстрации, а дешевой и проверяемой автоматизации математического поиска.

2. TruthInsightBench проверяет научных агентов на слепых задачах

TruthInsightBench предлагает 40 задач из рецензированных исследований в десяти научных областях. Агентам показывают нейтральную цель и замороженные данные, но скрывают выводы исходных работ. Четыре агентные системы набрали примерно 58,4–60,3 балла из 100: они умеют запускать анализ и оформлять ход работы, но часто проваливают контрольные проверки, устойчивость выводов, проверяемость гипотез и перенос на другие наборы данных. Для научного ИИ это полезный холодный душ: аккуратный отчет еще не равен хорошему исследованию.

3. SCILAWS-BENCH разделяет предсказание и открытие научных законов

Работа задает 118 задач на открытие научных закономерностей по материалам из 381 статьи и примерно восьми миллионов реальных точек данных в шести дисциплинах. Важная деталь: авторы отделяют подгонку под наблюдения от поиска осмысленной формулы, а также дают режим с запросами к синтетическим «параллельным мирам». Вывод неприятный, но ценный: хорошее предсказание может расходиться с научной правильностью, а выбор формы модели остается слабым местом.

4. SALTED ускоряет предсказание электронной плотности в молекулах и материалах

SALTED — открытый пакет для машинного обучения электронной плотности по координатам и типам атомов. Электронная плотность — один из дорогих этапов квантово-механического моделирования, поэтому переносимые приближенные методы здесь особенно важны. Авторы делают упор на работу и с молекулами, и с конденсированными средами, а также на отклик на электрическое поле. Если такие инструменты будут надежно переноситься между классами систем, они могут заметно сократить стоимость материаловедческих расчетов.

5. Агентные программы становятся новым типом научного ПО

В статье по вычислительному материаловедению предлагается смотреть на системы с большими языковыми моделями не как на чат-помощников, а как на новый вид научного программного обеспечения. Такие программы сочетают обычные алгоритмы, ограниченные решения модели, проверки, накопление опыта и делегирование подзадач. Пример DeMARS строит атомистические модели по экспериментально измеренным неупорядоченным кристаллическим структурам. Главная мысль практичная: ценность ИИ для науки растет там, где он встраивается в проверяемый рабочий процесс, а не просто пишет правдоподобные объяснения.