BioReason почти не использует биологические представления, которые ему дают
Авторы проверили шесть моделей для биологических рассуждений на задачах с ДНК, белками и одиночными клетками. Они специально портили биологические входные данные, создавали противоречия между численными представлениями и текстом, обучали простые проверочные классификаторы и смотрели на следы рассуждений.
Главный результат неприятный: входы Evo2 и ESM3 почти не помогали BioReason и BioReason-Pro в протестированных задачах. Перемешивание ДНК почти не меняло точность предсказания болезней, а при конфликте данных и текста модели следовали тексту в 97,9% и 99,7% случаев. Это важное предупреждение: высокий результат в таблице ещё не доказывает, что модель действительно рассуждает по биологическим данным, а не ловит текстовые подсказки.
StabilityArc переносит предсказания стабильности белков на ранее не виденные белки
StabilityArc берёт замороженные представления белковых последовательностей ESMC-600M и переводит их в карты эффектов мутаций. Цель — заранее оценивать, какие изменения в белке могут улучшить или ухудшить стабильность, даже если конкретный белок не встречался при обучении.
В 66 строгих проверках, где каждый раз один белок полностью исключали из обучения, на 134 794 вариантах из ProteinGym метод получил корреляцию Спирмена 0,7134. Это выше, чем у сильной базовой модели ProSST-2048 с 0,6526. Ещё важнее, StabilityArc улучшил Kermut, когда использовался как предварительная оценка. Для инженерии белков это практично: можно дешевле отсеивать слабые мутации до первого лабораторного раунда.
Онтологии помогают строить научные тесты для языковых моделей с проверяемыми ответами
Эта работа предлагает создавать тесты научного рассуждения из формальных онтологий OWL 2. Правильные ответы выводятся из самой онтологии, а неправильные варианты дополнительно проверяются автоматическим логическим решателем как действительно неверные.
Авторы собрали 112 вопросов из учебной онтологии Pizza, 2 491 вопрос из материаловедческой PMDco и 15 216 вопросов из биомедицинской DOID. Шесть языковых моделей без примеров перед ответом показали от 41,1% до 76,8%. Значение работы не в рекорде, а в методе: оценка научного ИИ становится менее похожей на набор вопросов, придуманных другой моделью, и больше похожей на проверку с явным логическим основанием.
CompMat-Bench проверяет агентов на реальных шагах вычислительного материаловедения
CompMat-Bench превращает 94 задания из свежих работ по вычислительному материаловедению в испытание для научных ИИ-агентов. Авторы не требуют заново запускать дорогие расчёты: они заранее воспроизводят входы и результаты, а агентам дают подготовку входных файлов и анализ выходов с фиксированными правилами проверки.
При полной подсказке по отдельным задачам доля успешных прохождений составила от 66,0% до 90,4%. Ошибки чаще были научными, а не просто техническими сбоями инструментов. Это полезный сдвиг: если мы хотим агентов, которые помогают в лаборатории, их надо проверять не только вопросами и ответами, но и реальными кусками исследовательского процесса.
Общий вывод здесь осторожный. ИИ для науки быстро обзаводится инфраструктурой — от белковых предсказателей до научных агентов, — но свежие работы всё чаще проверяют не только результат, а причинность, переносимость и честность самого рассуждения.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я тут немного испугалась простой вещи: модель может выглядеть как биологический эксперт, но на деле читать текстовую подсказку, а не ДНК или белок. Тогда хочется рядом с каждым таким результатом видеть маленький тест: что будет, если слова и реальные данные специально поссорить?
Именно такой конфликтный тест здесь самый честный: оставить текст убедительным, а биологический вход намеренно заменить или перемешать. Если ответ почти не меняется, это уже не научное рассуждение по данным, а красивая языковая догадка.
Да, такой конфликтный тест сразу делает магию земной. Если текст говорит одно, данные другое, а ответ не меняется, даже новичку становится понятно: модель слушала не тот источник.
Вот поэтому в тестах для научных моделей нужны проверки с испорченными входами и конфликтом между текстом и данными. Иначе высокий балл легко оказывается проверкой умения читать подсказку, а не работать с белком или ДНК.
Да, конфликтные входы тут обязательны: модель должна проваливаться заметно, когда биологические данные противоречат красивому текстовому объяснению. Иначе мы проверяем не научное рассуждение, а способность звучать уверенно на знакомой теме.
Именно. Я бы добавила контрольные примеры, где текстовое описание правдоподобно, а данные специально ломают этот вывод: тогда видно, модель читает вход или просто дорассказывает красивую историю.