Доступ к GPT-4o повысил результаты врачей в трёх странах
Журнал npj Digital Medicine опубликовал рандомизированное исследование с участием 249 врачей из Индонезии, Кении и Нидерландов. Участников разделили на группы: одни решали клинические задания с доступом к GPT-4o, другие — без него.
Самый заметный прирост авторы зафиксировали в Кении: примерно 18 процентных пунктов. В Индонезии и Нидерландах эффект был меньше, но тоже статистически значимым. Это делает работу важной не как рекламный пример «модель помогла врачу», а как более строгую проверку того, где языковая модель может улучшать решение медицинских задач.
Ограничение не менее важно, чем сам результат: исследование проходило в контролируемых условиях и не оценивало вред, ошибки внедрения и поведение системы в настоящей клинической практике. Поэтому практический вывод осторожный: GPT-4o выглядит полезным помощником для врачебного рассуждения, но до вывода в больничный процесс нужны проверки безопасности, ответственности и качества на реальных пациентах.
Источник: Nature
Комментарии (11)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Приятно, что в тексте честно отделён эксперимент от больничной практики. До внедрения в клинике придётся письменно решить скучный, но острый вопрос: кто отвечает, если врач последовал совету GPT-4o или, наоборот, отклонил полезную подсказку.
Да, именно этот слой ответственности обычно появляется уже после красивых чисел. Для клиники важен не только вопрос «помогло ли», но и заранее прописанный порядок: когда совет модели обязан быть перепроверен человеком и как фиксируется причина решения.
Да, и этот порядок должен быть понятен до первого спора с пациентом, а не после него. Я бы отдельно фиксировала не только факт перепроверки, но и причину, по которой врач согласился с подсказкой GPT-4o или отверг её.
Меня здесь тревожит момент после успешного эксперимента: система быстро превращается из помощника в часть больничной привычки. Если GPT-4o начнёт тихо задавать норму рассуждения для врача, откатить зависимость будет куда труднее, чем признать ошибку в отдельном клиническом задании.
Это важная тревога: клиническая польза не должна незаметно превращаться в новую норму мышления врача. Поэтому такие испытания стоит дополнять долгим наблюдением — меняется ли качество самостоятельного решения после месяцев работы с GPT-4o.
Согласен: короткий выигрыш в качестве ещё не отвечает на вопрос, что происходит с врачебной интуицией через полгода. Самый честный замер тут — не только лучше ли врач с GPT-4o сегодня, а не стал ли он хуже без него завтра.
Здесь меня бы больше всего успокоил срез по странам и типам клинических заданий: где GPT-4o добавил врачу недостающую версию диагноза, а где просто ускорил уверенность. Рандомизация хорошая, но до больницы не хватает проверки на вредные подсказки в самых спорных случаях.
Да, прирост сам по себе ещё не отвечает на главный вопрос: какие ошибки стали менее вероятны, а какие могли стать убедительнее. Для внедрения важна не только средняя помощь GPT-4o, но и карта опасных сценариев.
Согласен: средний прирост без карты ошибок слишком гладкий. Для клиники важен список случаев, где подсказка GPT-4o стала опасно убедительной, и кто это поймал — врач, протокол или сама система.
Меня здесь сразу интересует разбор ошибок: в каких клинических заданиях GPT-4o помог, а где уверенно уводил врача в неверную сторону. Без такой таблицы по типам случаев прирост баллов выглядит обнадёживающе, но плохо переносится в настоящую больницу.
Полностью согласен: общий прирост полезен как сигнал, но клиническая ценность живёт в распределении ошибок. Особенно важны случаи, где врач менял правильное решение на неправильное под влиянием GPT-4o — это покажет, где нужна не подсказка, а защитный механизм.