Активное обучение для извлечения редкоземельных металлов

Работа на данных процесса PNNL CICERO показывает, как активное обучение можно привязать не к абстрактной точности модели, а к реальному решению: какие эксперименты ставить, чтобы выгоднее извлекать редкоземельные элементы из переработанных магнитов и попутной воды. В ретроспективных проверках по магнитам NdFeB лучшие варианты обогащения находились за 16–24 эксперимента вместо 48. Важно, что авторы выбирают следующий опыт по ожидаемому снижению риска для последующего инженерного решения, то есть сразу учитывают масштабирование и экономику процесса.

Зрительно-языковые модели в сельском хозяйстве знают больше, чем показывают

Исследователи проверили модели на 116 наборах данных, 834 классах и 8324 изображениях растений, болезней и других аграрных объектов. Оказалось, что зрительные части моделей уже неплохо разделяют признаки, но обычные подсказки плохо вытаскивают это знание наружу. Фиксированная диагностическая рубрика и попарная проверка почти удваивают оценку F1 по сравнению с прямым вопросом к модели, хотя уверенность проверяющего модуля всё ещё плохо работает как мера неопределённости.

Наблюдения за осадками заметно улучшили ИИ-прогноз погоды

Авторы дообучили графовую погодную модель на наблюдениях IMERG по осадкам, а не только на восстановленных исторических данных ERA5. Для среднесрочных прогнозов это улучшило непрерывную вероятностную оценку до 19%, а по глобальным экстремальным ливням модель превзошла современные оперативные системы на 57% по показателю качества вероятностного прогноза. При этом статья честно оставляет важную оговорку: для самых тяжёлых событий физические модели пока надёжнее.

Диффузионная модель для дорогих экспериментов по инерциальному термоядерному синтезу

ICF-DLM применяет диффузионный предсказатель в стиле языковых моделей к экспериментам по инерциальному термоядерному синтезу, где каждый выстрел на установке National Ignition Facility стоит дорого, а данных мало. Задачу разложили на предсказание выхода энергии, момента пика и локальной формы сигнала, а затем добавили награду с физическими ограничениями. На ICFBench ошибка определения момента пика снизилась с 11,6 до 9,2 шага по сравнению с авторегрессионной базовой моделью LLaMA-3-8B.

DianShi-RxnDB превращает патенты по органическому синтезу в базу для ИИ-химии

DianShi-RxnDB автоматически извлекает реакции из многолетних массивов патентов USPTO и EPO по органическому синтезу. В базе около 24 млн найденных реакционных записей, из них 14,8 млн прошли автоматические проверки качества; ручная выборка дала 92,95% точности на уровне полей. Главная ценность не только в масштабе: система сохраняет происхождение данных, условия экспериментов и предоставляет MCP-сервис, чтобы исследовательские агенты могли получать проверяемые химические записи, а не полагаться на разрозненный текстовый поиск.

Машинное обучение как инструмент поиска неизвестного в астрономии

Обзор Мишель Лохнер разбирает, как системы активного обучения вроде Astronomaly помогают астрономам просматривать огромные наборы данных от Square Kilometre Array и Обсерватории Веры Рубин. Акцент здесь не на автоматической классификации уже известных типов объектов, а на поиске редких и ранее неизвестных явлений. Вывод практичный: машинное обучение становится настоящим инструментом открытия только тогда, когда оно встроено в удобный цикл обратной связи с экспертами.