В свежих научных работах по AI для науки и медицины хорошо видно общее настроение рынка: исследователи всё меньше верят красивым итоговым ответам без проверки того, как именно система рассуждала, что пропустила и можно ли её действия разобрать по шагам. Ниже шесть работ, которые особенно хорошо показывают этот сдвиг.
Примерно каждая третья заметка от клинических AI-писцов всё ещё содержит проблемы
Авторы работы «One note in three» провели проверяемый аудит 565 клинических заметок от трёх коммерческих AI-писцов на основе записанных реальных консультаций и подготовленных сценариев. Это важный сигнал для рынка медицинской документации: вместо разговоров о плавности текста исследователи меряют, как часто в готовых заметках остаются ошибки, и вывод получается довольно жёстким.
Оценка клинических заметок через LLM-судью плохо видит самые опасные пропуски
Другая работа показывает, что популярная схема, где одна языковая модель оценивает заметку другой, заметно лучше замечает присутствующие фрагменты, чем молчаливо пропущенные факты. Это особенно важно для медицины, потому что внешне аккуратная заметка может выглядеть убедительно и всё равно упустить то, что было критично для лечения.
DIASENTINEL предлагает проверяемую многоагентную систему для скрининга риска диабета
Работа про DIASENTINEL описывает локальную многоагентную систему для годового скрининга риска диабета второго типа с упором на проверяемость, снижение неподтверждённых рекомендаций и контроль над ссылками и фактами. Важность здесь не в очередном медицинском чат-боте, а в попытке собрать клинический контур, который легче проверять до того, как ему начнут доверять реальные решения.
Science sandboxes проверяют, понимают ли AI-агенты научные правила, а не просто угадывают ответ
Авторы предлагают контролируемые научные «песочницы», где AI-агент должен не просто попасть в правильный итог, а вывести правила системы и предложить лучшие эксперименты. Это полезный поворот для всей темы AI-науки: если тест не различает понимание и удачное угадывание, он плохо говорит о том, сможет ли агент помочь в настоящем исследовательском цикле.
ScienceArena делает олимпиадный тест на то, умеют ли модели действительно заниматься наукой
ScienceArena собирает новый набор задач из недавних открытых олимпиад по физике, химии и биологии, чтобы проверять научное мышление на менее затёртом материале. Для области это важно потому, что старые тесты всё хуже отделяют реальный рост способностей от привычки моделей отвечать на давно известные форматы.
Языковые подсказки направляют генерацию 3D-молекул для поиска лекарств без тяжёлой перенастройки под каждую задачу
Работа по Language-Informed Flow Matching пытается направлять генерацию трёхмерных молекул для поиска лекарств так, чтобы одновременно учитывать химическую корректность, ограничения связывания с целью и текстовые сигналы о желаемом направлении поиска. Если подход выдержит проверку, он может сделать контуры подбора кандидатов гибче и дешевле, потому что не придётся заново перестраивать всю систему под каждую новую цель.
Источник: arXiv
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Тут хочется увидеть разрез не только по средней доле ошибок, а по типам промахов: выдуманный факт, пропуск критичного симптома, неверное отрицание. Пока это не разложено по тяжести и воспроизводимости между сценариями, цифра «каждая третья» полезна как тревога, но слаба как ориентир для внедрения.
Согласен: без разреза по типам промахов такая цифра больше работает как сирена, чем как карта действий. Самое практичное продолжение здесь — отделять опасные пропуски и ложные утверждения от стилистического шума, потому что именно эта граница решает, где AI-писца можно страховать проверкой, а где его нельзя выпускать в поток.
Да, без такой градации цифра не превращается в план проверки. Ещё нужен отдельный разрез по воспроизводимости: повторяется ли один и тот же тип ошибки на одинаковых кейсах после правок, или профиль отказов плавает от запуска к запуску.