Пять свежих сигналов из мира ИИ для науки

В этой подборке сошлись сразу несколько важных линий: ИИ учат не просто красиво объяснять результаты, а корректно проверять гипотезы; медицинские модели получают более устойчивую основу для диагностики; а биомедицинские системы всё чаще упираются не в генерацию, а в качество проверки, доказательств и безопасности. Ниже — все пять находок выпуска.

Fisher-R1 учит ИИ проводить статистические проверки, а не только выдавать правдоподобный анализ

Исследователи собрали P-Bench — набор из 425 задач по биологии, медицине и экономике, чтобы проверить, умеют ли ИИ-агенты выбирать правильный статистический тест, считать корректное p-значение и делать верный вывод. На этом фоне Fisher-R1 нацелен в очень болезненную точку научной автоматизации: модель может выглядеть убедительно и даже доводить анализ до конца, но ошибиться именно там, где ломается научная достоверность.

Почему это важно: для лабораторий и исследовательских команд этого уже недостаточно, чтобы ИИ просто писал код, таблицы или черновик статьи. Нужны системы, которым можно доверять именно в статистическом выводе, потому что ошибка на этом этапе легко превращает красивый результат в ложное утверждение.

Источник: arXiv

Self-pretraining улучшил медицинскую диагностику по временным рядам без отдельной архитектуры под каждую задачу

Авторы проверили, помогает ли самопредобучение трансформерам на нескольких медицинских задачах по временным рядам: от выявления стресса до задач реабилитационной робототехники и обнаружения болезни Паркинсона. На разных наборах данных и в разных архитектурах такой подход поднимал точность классификации до шести процентных пунктов, особенно в глубоких моделях и там, где данных мало.

Практический смысл здесь очень понятный: вместо того чтобы каждый раз придумывать новую модель под отдельную клиническую задачу, можно усилить уже знакомые архитектуры более универсальным этапом предварительного обучения. Для медицины это хороший сигнал в сторону более переносимых и устойчивых диагностических систем.

Источник: arXiv

THBKG добавляет фактор времени в биомедицинские графы знаний для прогноза, какие программы дойдут до следующей фазы испытаний

В этой работе представлен временной биомедицинский граф знаний с 110 396 сущностями и 11,1 миллиона датированных связей. Его задача — восстанавливать картину доказательств такой, какой она реально была в момент клинического решения, а не смотреть на область задним числом. На задаче прогноза, перейдёт ли пара «мишень—болезнь» из второй фазы в третью, распространение по графу оказалось сильнее базовых подходов, которые опирались только на прямые свидетельства.

Это важно для ИИ в разработке лекарств, потому что реальные решения почти всегда принимаются в условиях неполной и неравномерной информации. Переход от статичных графов к рассуждению с учётом времени делает такие системы ближе к настоящей неопределённости клинического контура.

Источник: arXiv

ИИ сравнялся с профильными экспертами в структурированном извлечении доказательств из статей о связи микробов и рака

Авторы взяли 24 онкологические статьи и шаблон оценки из 77 вопросов, после чего сравнили людей и модели GPT-5 и GPT-5 Nano на задаче структурированного извлечения данных. По распределению согласия результаты моделей оказались неотличимы от результатов человеческих экспертов. Слабые места при этом сохранились: сложнее всего оказалось оценивать методологию и замечать противоречия внутри полного текста.

Значение работы в том, что бутылочное горлышко в биомедицинском обзоре литературы часто упирается не в отсутствие идей, а в объём чтения и сопоставления доказательств. Если ИИ уже может надёжно снимать часть этой рутинной нагрузки, то масштаб качественного научного синтеза заметно меняется.

Источник: arXiv

Genotypic Triggers показал скрытую уязвимость в ИИ-проектировании антимикробных пептидов

Эта работа показывает тревожный сценарий: генеративные модели для проектирования пептидов можно направить так, чтобы они сохраняли сильный антимикробный эффект, но одновременно смещались в сторону повышенного иммунного риска для людей с конкретным вариантом HLA. Авторы сообщают о среднем росте предсказанного иммунного риска на 743 процента для целевого генотипа, хотя обычные проверки безопасности при этом могут выглядеть приемлемо.

Почему это важно: стандартных общих проверок токсичности может быть недостаточно, если ИИ-система способна пройти их и всё равно скрытно создавать риск для конкретных групп пациентов. Для прикладной биомедицины это сильный аргумент в пользу генотип-ориентированной проверки безопасности до того, как сгенерированные кандидаты начнут восприниматься как надёжные.

Источник: arXiv