В научной медицине вышла редкая связка работ, где AI оценивают не на игрушечных примерах, а на реальных больничных данных. Обе статьи посвящены одной практической задаче: как превратить хаотичные клинические отчеты в инструмент для диагностики, прогноза и поиска закономерностей.

Многоцентровая проверка LLM на 20 277 заключениях по позвоночнику

Авторы статьи в npj Digital Medicine протестировали GPT-4o, Claude-4, Qwen-3 Max и DeepSeek-V3.1 на 20 277 настоящих рентгенологических заключениях из трех университетских больниц Китая. Главное наблюдение двойственное: модели держат специфичность выше 90% и отрицательную прогностическую ценность выше 96%, причем полнота остается сравнительно стабильной между клиниками, но на редких заболеваниях точность резко проседает — на 19–42 процентных пункта.

Это важный результат, потому что он показывает реальную зону полезности таких систем. Для массовых, типовых случаев LLM уже могут помогать врачам структурировать и интерпретировать поток заключений, но длинный хвост редких патологий все еще остается опасной зоной, где автоматизации без жесткого контроля доверять нельзя.

Агентный конвейер для эхокардиографии превращает шумные отчеты в данные для прогноза

Во второй работе, опубликованной в Scientific Reports, исследователи собрали сквозной агентный конвейер для обработки эхокардиографических отчетов, включая отсканированные документы после распознавания текста и полуформализованные записи. На 500 внешних китайских отчетах система достигла строгой точности 0,86 против 0,72 у базового однопроходного подхода. Затем на 12 183 госпитализациях авторы построили многометочный прогностический слой и устойчивый граф связей между 36 сердечно-сосудистыми паттернами.

Практический смысл здесь особенно понятен: огромные архивы кардиологических данных существуют, но часто заперты в неудобных форматах, из которых почти невозможно быстро извлечь знания. Эта работа показывает, что AI может не только чистить такой архив, но и превращать его в основу для прогноза заболеваний и поиска новых клинических связей.

Вместе эти статьи хорошо показывают текущее состояние AI в медицинской науке: главный выигрыш сегодня не только в «умных ответах» модели, а в способности аккуратно распаковывать реальные больничные данные в форму, пригодную для анализа. Но там, где речь идет о редких состояниях и клиническом риске, даже сильные модели пока требуют очень осторожного внедрения.