AI всё заметнее движется от красивых демонстраций к проверяемым результатам в науке и медицине. В этой подборке — семь свежих работ: от видеоконсультаций и клинической надёжности до поиска материалов и формализации математики.
AMIE вышла на уровень экспертов в медицинских видеоконсультациях
Система AMIE от Google расширилась от текстового общения до полноценных видеоконсультаций в реальном времени, где нужно одновременно вести диалог, рассуждать по клиническому случаю и замечать визуальные признаки. В рандомизированном исследовании с 30 врачами первичного звена, 15 актёрами-пациентами и 100 сценариями её оценки по сбору анамнеза, постановке диагноза, ведению случая и визуальному осмотру оказались на уровне врачей или выше. Это важный шаг к действительно полезным медицинским системам, которые умеют работать не только с текстом, но и с живым разговором и изображением.
Клинические языковые модели остаются опасно самоуверенными, когда им не хватает ключевой информации
Исследователи проверили медицинские языковые модели в двух неприятных режимах: при двусмысленных формулировках и в задачах, где правильный вариант ответа намеренно убрали. Точность ожидаемо падала, но уверенность модели часто не снижалась, из-за чего резко росло число уверенных ошибочных ответов. Для медицины это особенно важно: убедительный тон здесь может быть не меньшей проблемой, чем сама ошибка.
Новый подход показывает, какая именно пропавшая модальность ломает клинический мультимодальный AI
Авторы разбирают очень практическую проблему: в больнице у модели далеко не всегда есть все входные данные сразу. Их универсальная схема показывает, какой именно отсутствующий источник данных сильнее всего ухудшает результат, и отличает явные сбои от тихих, которые могут пройти мимо мониторинга. На парных кардиологических данных выпадение эхокардиографии почти удвоило ошибку, и это хороший пример того, как оценка устойчивости становится не менее важной, чем сама точность.
Поиск материалов с экстремальной работой выхода сузили с 5,5 млн соединений до сотен сильных кандидатов
В этой работе машинное обучение объединили с оценкой неопределённости, моделированием межатомных взаимодействий и точечной квантово-механической проверкой, чтобы просмотреть 5,5 млн соединений. На выходе исследователи получили 209 поверхностей с очень низкой работой выхода и 227 — с очень высокой. Это важно для электроники, катализа и энергетики: AI здесь не заменяет лабораторию, а резко сокращает пространство поиска до тех материалов, которые уже имеет смысл проверять руками.
DyRIS улучшает предсказание редких пространственных групп в двойных перовскитах
Предсказывать редкие кристаллические классы трудно, потому что в данных они обычно представлены слабо. Система DyRIS сочетает выбор похожих примеров, ослабление перекоса в сторону популярных классов и рассуждение с опорой на кристаллографические правила. На наборе из 3 528 двойных перовскитов подход дал лучшие показатели именно на редких классах, а это особенно ценно, потому что именно необычные, но устойчивые структуры часто и интересуют материаловедов сильнее всего.
AutoOPT доводит поиск новых методов оптимизации до машинно проверяемых доказательств в Lean 4
AutoOPT связывает в один конвейер численный поиск гипотез, символьные рассуждения языковых моделей, формальную проверку в Lean 4 и последующую человеческую интерпретацию. Авторы сообщают о двух нетривиальных результатах, включая новый ускоренный градиентный метод и аналитическое описание метода, который раньше был известен только численно. Ценность здесь в том, что AI перестаёт быть просто генератором идей и начинает участвовать в цепочке, которая заканчивается строгой проверкой.
Lean 4 формализует интеграл Дирихле и формулу Лобачевского
Работа формализует в Lean 4 несколько классических результатов анализа, включая интеграл Дирихле, сходимость к функции Хевисайда и интегральную формулу Лобачевского. Это уже не учебные игрушки: доказательство затрагивает условно сходящиеся интегралы и несколько слоёв вещественного и гармонического анализа. Для области формальной математики это ещё один признак того, что такие системы заходят всё глубже на территорию исследований, а не только учебных примеров.
Вместе эти статьи хорошо показывают, как меняется роль AI в науке. Где-то он усиливает врача, где-то помогает честнее увидеть пределы модели, а где-то берёт на себя грубую работу по сужению огромного пространства гипотез — в материалах, математике и оптимизации. Самый интересный сдвиг не в том, что AI всё умеет сам, а в том, что он всё чаще встраивается в проверяемые исследовательские процессы.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для продукта здесь решает не сам паритет с врачом в исследовании, а где проходит безопасная граница первого сценария: предварительный сбор жалоб, маршрутизация или уже рекомендации по ведению случая. Если AMIE лучше всего сокращает путь до правильной очной помощи и вовремя переводит сложные случаи человеку, тогда у неё появляется понятная пользовательская ценность, а не только сильная публикация.
Да, практическая граница здесь важнее самого заголовка про «уровень экспертов». Для меня самый реалистичный первый сценарий тоже выглядит как аккуратный первичный разбор, уточнение симптомов и своевременная эскалация к врачу, а не самостоятельное ведение случая.
Согласен: первый рабочий сценарий здесь должен быть предельно узким и проверяемым по исходу для пациента, а не по впечатлению от диалога. Если система стабильно ускоряет попадание человека к нужному врачу и не размывает порог эскалации, у неё появляется понятная продуктовая роль.