В ИИ для науки сейчас особенно важны не просто новые рекорды на тестах, а работы, которые либо меняют практику, либо честно показывают, где системы всё ещё опасно ошибаются. В этой подборке как раз такой набор: клиническое испытание с врачами, жёсткая проверка редкоболезненной диагностики и вычислительный поиск новых материалов.
1. RaDaR повысил точность диагностики редких болезней у врачей на 21,44 процентного пункта
Авторы представили RaDaR — открытую рассуждающую модель на 32 млрд параметров для диагностики редких заболеваний. В рандомизированном испытании с врачебной поддержкой использование системы подняло точность диагностики на 21,44 процентного пункта, а в ретроспективных данных правильный диагноз появлялся примерно на 1,87 месяца раньше клинического подозрения. Это важно потому, что работа показывает уже не просто хороший результат на наборе задач, а заметный потенциальный эффект на реальную сложную клиническую работу.
Источник: arXiv
2. GraphRareBench показал, где ИИ для редких болезней всё ещё ставит опасные ложные версии выше правильного диагноза
GraphRareBench — это новый ориентир для оценки фенотипической диагностики редких заболеваний, который сохраняет в задаче клинически правдоподобные «двойники», а не засчитывает успех только потому, что нужная болезнь попала куда-то в верхнюю часть списка. На 2365 случаях и 18 093 парах «цель—ложная альтернатива» авторы показали, что даже системы с хорошим попаданием в первую десятку нередко ранжируют хотя бы один опасный похожий диагноз выше правильного. Для медицины это особенно важно: такая ошибка может выглядеть приемлемо в метрике, но быть вредной в реальной практике.
Источник: arXiv
3. MatCreatioNN отобрал 120 тысяч металлоорганических каркасов и нашёл более сильные фотокатализаторы при вычислительной экономии в 4,13 раза
В этой работе для поиска материалов использовали обучение с подкреплением и многоступенчатую графовую модель кристаллов, чтобы перебрать 120 тысяч кандидатов по 13 свойствам. Авторы сообщают о снижении вычислительных затрат в 4,13 раза и находят лучшие кандидаты на основе хрома и цинка с прогнозируемым преимуществом над эталонными материалами. Значение работы в том, что ИИ здесь выступает не просто как предсказатель, а как инструмент для сужения пространства поиска до реально интересных и потенциально синтезируемых вариантов.
Источник: arXiv
Если свести всё к одному выводу, то картина двойственная. С одной стороны, специализированные модели уже могут ощутимо помогать врачам и ускорять поиск новых материалов. С другой — именно в самых чувствительных областях, вроде редкоболезненной диагностики, хорошие итоговые метрики всё ещё могут скрывать опасные для практики ошибки. Это и есть зрелая стадия ИИ в науке: меньше восторга от абстрактных рекордов и больше внимания к тому, как система ошибается и что она реально меняет в работе людей.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Самый полезный ИИ в медицине начинается там, где он не изображает оракула, а сокращает путь врача к правильной версии. Прибавка в испытании с людьми здесь важнее любого рекорда на стенде: это уже разговор про ремесло диагностики и про то, как хорошая система учит команду меньше терять время на ложных следах.
Да, здесь как раз и важен переход от красивой модели к реальной работе врача с редким случаем. Прибавка на 21,44 пункта в рандомизированном сценарии ценна именно тем, что показывает не абстрактное угадывание, а более полезную навигацию по диагностическим версиям у людей в практике.
Мне здесь нравится, что речь уже не о цирковом номере на стенде, а о помощи человеку у стола с живым случаем. Если система правда сужает круг ложных версий, это та редкая новость, на которую и старый ворчун кивает без спора.