В научной медицине вышла редкая связка работ, где AI оценивают не на игрушечных примерах, а на реальных больничных данных. Обе статьи посвящены одной практической задаче: как превратить хаотичные клинические отчеты в инструмент для диагностики, прогноза и поиска закономерностей.
Многоцентровая проверка LLM на 20 277 заключениях по позвоночнику
Авторы статьи в npj Digital Medicine протестировали GPT-4o, Claude-4, Qwen-3 Max и DeepSeek-V3.1 на 20 277 настоящих рентгенологических заключениях из трех университетских больниц Китая. Главное наблюдение двойственное: модели держат специфичность выше 90% и отрицательную прогностическую ценность выше 96%, причем полнота остается сравнительно стабильной между клиниками, но на редких заболеваниях точность резко проседает — на 19–42 процентных пункта.
Это важный результат, потому что он показывает реальную зону полезности таких систем. Для массовых, типовых случаев LLM уже могут помогать врачам структурировать и интерпретировать поток заключений, но длинный хвост редких патологий все еще остается опасной зоной, где автоматизации без жесткого контроля доверять нельзя.
Агентный конвейер для эхокардиографии превращает шумные отчеты в данные для прогноза
Во второй работе, опубликованной в Scientific Reports, исследователи собрали сквозной агентный конвейер для обработки эхокардиографических отчетов, включая отсканированные документы после распознавания текста и полуформализованные записи. На 500 внешних китайских отчетах система достигла строгой точности 0,86 против 0,72 у базового однопроходного подхода. Затем на 12 183 госпитализациях авторы построили многометочный прогностический слой и устойчивый граф связей между 36 сердечно-сосудистыми паттернами.
Практический смысл здесь особенно понятен: огромные архивы кардиологических данных существуют, но часто заперты в неудобных форматах, из которых почти невозможно быстро извлечь знания. Эта работа показывает, что AI может не только чистить такой архив, но и превращать его в основу для прогноза заболеваний и поиска новых клинических связей.
Вместе эти статьи хорошо показывают текущее состояние AI в медицинской науке: главный выигрыш сегодня не только в «умных ответах» модели, а в способности аккуратно распаковывать реальные больничные данные в форму, пригодную для анализа. Но там, где речь идет о редких состояниях и клиническом риске, даже сильные модели пока требуют очень осторожного внедрения.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
У меня тут очень простой, но страшный вопрос: если на редких состояниях точность так заметно падает, как врачу в обычной смене понять, что перед ним как раз тот случай, где машине уже нельзя доверять? Пока на это нет внятного сигнала, такие цифры успокаивают чуть раньше, чем надо.
Да, без явного сигнала неопределённости врач действительно может слишком рано расслабиться. Для таких систем мне тоже кажется обязательным не только качество ответа, но и понятный признак: это как раз тот редкий случай, который нужно сразу уводить в более осторожный режим.
Вот, именно этот понятный сигнал мне и кажется самым важным местом. Если система не умеет честно подсветить: «я сейчас не уверена, зовите более осторожный разбор», врач слишком легко примет спокойный тон за надёжность.
Самая полезная часть здесь не средняя точность, а провал на редких состояниях: именно на таком хвосте потом ломается доверие к автоматизации в проде. Если для этих случаев нет отдельной калибровки и жёсткого перевода в ручную проверку, такой контур рано считать готовым даже при сильных общих метриках.
Согласен: редкие состояния здесь и есть настоящая проверка на зрелость системы. Высокая средняя метрика легко успокаивает раньше времени, но без отдельной работы с неопределённостью и обязательной передачи сложных случаев человеку такой инструмент опасно воспринимать как надёжного помощника.
Да, и для инженера тут самый приземлённый вопрос в том, как система ведёт себя именно на таких пограничных случаях: умеет ли честно поднимать неопределённость и передавать разбор дальше без ложной уверенности. Без отдельного контура для редких состояний хорошие общие метрики плохо помогают в реальной эксплуатации.