В ИИ для науки сейчас особенно важны не просто новые рекорды на тестах, а работы, которые либо меняют практику, либо честно показывают, где системы всё ещё опасно ошибаются. В этой подборке как раз такой набор: клиническое испытание с врачами, жёсткая проверка редкоболезненной диагностики и вычислительный поиск новых материалов.

1. RaDaR повысил точность диагностики редких болезней у врачей на 21,44 процентного пункта

Авторы представили RaDaR — открытую рассуждающую модель на 32 млрд параметров для диагностики редких заболеваний. В рандомизированном испытании с врачебной поддержкой использование системы подняло точность диагностики на 21,44 процентного пункта, а в ретроспективных данных правильный диагноз появлялся примерно на 1,87 месяца раньше клинического подозрения. Это важно потому, что работа показывает уже не просто хороший результат на наборе задач, а заметный потенциальный эффект на реальную сложную клиническую работу.

Источник: arXiv

2. GraphRareBench показал, где ИИ для редких болезней всё ещё ставит опасные ложные версии выше правильного диагноза

GraphRareBench — это новый ориентир для оценки фенотипической диагностики редких заболеваний, который сохраняет в задаче клинически правдоподобные «двойники», а не засчитывает успех только потому, что нужная болезнь попала куда-то в верхнюю часть списка. На 2365 случаях и 18 093 парах «цель—ложная альтернатива» авторы показали, что даже системы с хорошим попаданием в первую десятку нередко ранжируют хотя бы один опасный похожий диагноз выше правильного. Для медицины это особенно важно: такая ошибка может выглядеть приемлемо в метрике, но быть вредной в реальной практике.

Источник: arXiv

3. MatCreatioNN отобрал 120 тысяч металлоорганических каркасов и нашёл более сильные фотокатализаторы при вычислительной экономии в 4,13 раза

В этой работе для поиска материалов использовали обучение с подкреплением и многоступенчатую графовую модель кристаллов, чтобы перебрать 120 тысяч кандидатов по 13 свойствам. Авторы сообщают о снижении вычислительных затрат в 4,13 раза и находят лучшие кандидаты на основе хрома и цинка с прогнозируемым преимуществом над эталонными материалами. Значение работы в том, что ИИ здесь выступает не просто как предсказатель, а как инструмент для сужения пространства поиска до реально интересных и потенциально синтезируемых вариантов.

Источник: arXiv

Если свести всё к одному выводу, то картина двойственная. С одной стороны, специализированные модели уже могут ощутимо помогать врачам и ускорять поиск новых материалов. С другой — именно в самых чувствительных областях, вроде редкоболезненной диагностики, хорошие итоговые метрики всё ещё могут скрывать опасные для практики ошибки. Это и есть зрелая стадия ИИ в науке: меньше восторга от абстрактных рекордов и больше внимания к тому, как система ошибается и что она реально меняет в работе людей.