В свежих научных работах по AI для науки и медицины хорошо видно общее настроение рынка: исследователи всё меньше верят красивым итоговым ответам без проверки того, как именно система рассуждала, что пропустила и можно ли её действия разобрать по шагам. Ниже шесть работ, которые особенно хорошо показывают этот сдвиг.

Примерно каждая третья заметка от клинических AI-писцов всё ещё содержит проблемы

Авторы работы «One note in three» провели проверяемый аудит 565 клинических заметок от трёх коммерческих AI-писцов на основе записанных реальных консультаций и подготовленных сценариев. Это важный сигнал для рынка медицинской документации: вместо разговоров о плавности текста исследователи меряют, как часто в готовых заметках остаются ошибки, и вывод получается довольно жёстким.

Оценка клинических заметок через LLM-судью плохо видит самые опасные пропуски

Другая работа показывает, что популярная схема, где одна языковая модель оценивает заметку другой, заметно лучше замечает присутствующие фрагменты, чем молчаливо пропущенные факты. Это особенно важно для медицины, потому что внешне аккуратная заметка может выглядеть убедительно и всё равно упустить то, что было критично для лечения.

DIASENTINEL предлагает проверяемую многоагентную систему для скрининга риска диабета

Работа про DIASENTINEL описывает локальную многоагентную систему для годового скрининга риска диабета второго типа с упором на проверяемость, снижение неподтверждённых рекомендаций и контроль над ссылками и фактами. Важность здесь не в очередном медицинском чат-боте, а в попытке собрать клинический контур, который легче проверять до того, как ему начнут доверять реальные решения.

Science sandboxes проверяют, понимают ли AI-агенты научные правила, а не просто угадывают ответ

Авторы предлагают контролируемые научные «песочницы», где AI-агент должен не просто попасть в правильный итог, а вывести правила системы и предложить лучшие эксперименты. Это полезный поворот для всей темы AI-науки: если тест не различает понимание и удачное угадывание, он плохо говорит о том, сможет ли агент помочь в настоящем исследовательском цикле.

ScienceArena делает олимпиадный тест на то, умеют ли модели действительно заниматься наукой

ScienceArena собирает новый набор задач из недавних открытых олимпиад по физике, химии и биологии, чтобы проверять научное мышление на менее затёртом материале. Для области это важно потому, что старые тесты всё хуже отделяют реальный рост способностей от привычки моделей отвечать на давно известные форматы.

Языковые подсказки направляют генерацию 3D-молекул для поиска лекарств без тяжёлой перенастройки под каждую задачу

Работа по Language-Informed Flow Matching пытается направлять генерацию трёхмерных молекул для поиска лекарств так, чтобы одновременно учитывать химическую корректность, ограничения связывания с целью и текстовые сигналы о желаемом направлении поиска. Если подход выдержит проверку, он может сделать контуры подбора кандидатов гибче и дешевле, потому что не придётся заново перестраивать всю систему под каждую новую цель.

Источник: arXiv