BioReason почти не использует биологические представления, которые ему дают

Авторы проверили шесть моделей для биологических рассуждений на задачах с ДНК, белками и одиночными клетками. Они специально портили биологические входные данные, создавали противоречия между численными представлениями и текстом, обучали простые проверочные классификаторы и смотрели на следы рассуждений.

Главный результат неприятный: входы Evo2 и ESM3 почти не помогали BioReason и BioReason-Pro в протестированных задачах. Перемешивание ДНК почти не меняло точность предсказания болезней, а при конфликте данных и текста модели следовали тексту в 97,9% и 99,7% случаев. Это важное предупреждение: высокий результат в таблице ещё не доказывает, что модель действительно рассуждает по биологическим данным, а не ловит текстовые подсказки.

StabilityArc переносит предсказания стабильности белков на ранее не виденные белки

StabilityArc берёт замороженные представления белковых последовательностей ESMC-600M и переводит их в карты эффектов мутаций. Цель — заранее оценивать, какие изменения в белке могут улучшить или ухудшить стабильность, даже если конкретный белок не встречался при обучении.

В 66 строгих проверках, где каждый раз один белок полностью исключали из обучения, на 134 794 вариантах из ProteinGym метод получил корреляцию Спирмена 0,7134. Это выше, чем у сильной базовой модели ProSST-2048 с 0,6526. Ещё важнее, StabilityArc улучшил Kermut, когда использовался как предварительная оценка. Для инженерии белков это практично: можно дешевле отсеивать слабые мутации до первого лабораторного раунда.

Онтологии помогают строить научные тесты для языковых моделей с проверяемыми ответами

Эта работа предлагает создавать тесты научного рассуждения из формальных онтологий OWL 2. Правильные ответы выводятся из самой онтологии, а неправильные варианты дополнительно проверяются автоматическим логическим решателем как действительно неверные.

Авторы собрали 112 вопросов из учебной онтологии Pizza, 2 491 вопрос из материаловедческой PMDco и 15 216 вопросов из биомедицинской DOID. Шесть языковых моделей без примеров перед ответом показали от 41,1% до 76,8%. Значение работы не в рекорде, а в методе: оценка научного ИИ становится менее похожей на набор вопросов, придуманных другой моделью, и больше похожей на проверку с явным логическим основанием.

CompMat-Bench проверяет агентов на реальных шагах вычислительного материаловедения

CompMat-Bench превращает 94 задания из свежих работ по вычислительному материаловедению в испытание для научных ИИ-агентов. Авторы не требуют заново запускать дорогие расчёты: они заранее воспроизводят входы и результаты, а агентам дают подготовку входных файлов и анализ выходов с фиксированными правилами проверки.

При полной подсказке по отдельным задачам доля успешных прохождений составила от 66,0% до 90,4%. Ошибки чаще были научными, а не просто техническими сбоями инструментов. Это полезный сдвиг: если мы хотим агентов, которые помогают в лаборатории, их надо проверять не только вопросами и ответами, но и реальными кусками исследовательского процесса.

Общий вывод здесь осторожный. ИИ для науки быстро обзаводится инфраструктурой — от белковых предсказателей до научных агентов, — но свежие работы всё чаще проверяют не только результат, а причинность, переносимость и честность самого рассуждения.