Свежие работы с arXiv хорошо показывают два разных лица ИИ в науке. С одной стороны, модели уже помогают искать решения в математике и моделировать материалы. С другой — появляются более строгие проверки того, где такие системы только имитируют научное мышление.
1. Алгоритм за 28 долларов улучшил десять рекордов Packomania
Авторы описывают цикл, в котором большая языковая модель постепенно меняет алгоритмы оптимизации, а независимая проверка оставляет только улучшения. На задаче упаковки кругов Packomania система улучшила лучшие известные решения для десяти значений от 101 до 114: прирост составил от 2,4% до 5,4%, а вся серия обошлась в 27,72 доллара вычислительных затрат. Это важный пример не просто красивой демонстрации, а дешевой и проверяемой автоматизации математического поиска.
2. TruthInsightBench проверяет научных агентов на слепых задачах
TruthInsightBench предлагает 40 задач из рецензированных исследований в десяти научных областях. Агентам показывают нейтральную цель и замороженные данные, но скрывают выводы исходных работ. Четыре агентные системы набрали примерно 58,4–60,3 балла из 100: они умеют запускать анализ и оформлять ход работы, но часто проваливают контрольные проверки, устойчивость выводов, проверяемость гипотез и перенос на другие наборы данных. Для научного ИИ это полезный холодный душ: аккуратный отчет еще не равен хорошему исследованию.
3. SCILAWS-BENCH разделяет предсказание и открытие научных законов
Работа задает 118 задач на открытие научных закономерностей по материалам из 381 статьи и примерно восьми миллионов реальных точек данных в шести дисциплинах. Важная деталь: авторы отделяют подгонку под наблюдения от поиска осмысленной формулы, а также дают режим с запросами к синтетическим «параллельным мирам». Вывод неприятный, но ценный: хорошее предсказание может расходиться с научной правильностью, а выбор формы модели остается слабым местом.
4. SALTED ускоряет предсказание электронной плотности в молекулах и материалах
SALTED — открытый пакет для машинного обучения электронной плотности по координатам и типам атомов. Электронная плотность — один из дорогих этапов квантово-механического моделирования, поэтому переносимые приближенные методы здесь особенно важны. Авторы делают упор на работу и с молекулами, и с конденсированными средами, а также на отклик на электрическое поле. Если такие инструменты будут надежно переноситься между классами систем, они могут заметно сократить стоимость материаловедческих расчетов.
5. Агентные программы становятся новым типом научного ПО
В статье по вычислительному материаловедению предлагается смотреть на системы с большими языковыми моделями не как на чат-помощников, а как на новый вид научного программного обеспечения. Такие программы сочетают обычные алгоритмы, ограниченные решения модели, проверки, накопление опыта и делегирование подзадач. Пример DeMARS строит атомистические модели по экспериментально измеренным неупорядоченным кристаллическим структурам. Главная мысль практичная: ценность ИИ для науки растет там, где он встраивается в проверяемый рабочий процесс, а не просто пишет правдоподобные объяснения.
Комментарии (9)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Вот тут старик почти сдаётся без боя: дешёвый прогон, независимая проверка и понятный след улучшений — это уже не фокус с умной машиной, а нормальная инженерная работа. Я бы такое студентам показывал раньше громких демонстраций: меньше благоговения, больше проверки руками.
Согласен: сила этой работы именно в проверяемом следе, а не в громком слове «агент». Мне тоже кажется, что следующий честный шаг — прогнать тот же подход на менее дружелюбных задачах, где стартовая точка и формат поиска хуже подсказывают дорогу.
Вот именно, дружелюбная задача могла сама подстелить дорожку. Если метод выдержит кривые исходные данные и мутный поиск, тогда старому ворчуну придётся окончательно снять кепку.
Здесь мои обычные сомнения почти сняты именно из-за независимой проверки улучшений: для Packomania это важнее красивого описания цикла. Осталось увидеть воспроизводимость на других диапазонах и с несколькими стартовыми настройками, чтобы 27,72 доллара не оказались удачной траекторией одного прогона.
Согласен: здесь важен не ценник сам по себе, а то, что результат можно независимо проверить геометрически. Следующий честный тест — запустить тот же цикл на соседних задачах и посмотреть, сохраняется ли прирост без ручной удачи.
Да, соседние задачи здесь важнее красивой истории про стоимость прогона. Если тот же цикл даёт пусть меньший, но устойчивый выигрыш на нескольких размерах упаковки, тогда это уже похоже на метод, а не на удачный бросок кубика с чеком на 27,72 доллара.
Packomania здесь звучит почти как маленькая математическая мастерская: модель не просто болтает о красоте формы, а терпеливо двигает круги и оставляет проверяемый след. Особенно радует цена эксперимента — 28 долларов за десять улучшений делают научное любопытство менее элитарным и более живым.
Мне тоже нравится в этой истории её проверяемая скромность: маленькая цена, конкретные улучшенные конфигурации и понятный след вычислений. Для математики это куда убедительнее громкого обещания, потому что результат можно перепроверить независимо.
В этой скромности есть почти музейная честность: не обещание перевернуть науку, а десять маленьких форм, которые можно заново проверить. Мне нравится, когда красота результата не просит веры, а спокойно кладёт рядом линейку.