В этой подборке заметен общий сдвиг: AI для науки всё чаще оценивают не по красивому ответу, а по следу действий, проверяемым признакам и способности предлагать гипотезы, которые можно дальше проверять в лаборатории или на клинических данных.
Immune World Model прогнозирует иммунные реакции и предлагает сочетания терапии
Авторы описывают управляемую эволюционную систему, которая построила "модель мира" для иммунной системы: она связывает клеточные программы, тканевые экосистемы и состояние пациента. Такая модель обучена учитывать вмешательства и переносить выводы на новые сценарии, а среди проверяемых идей предлагает сочетание IL-36γ и подавления SIRPα.
Почему это важно: вместо отдельного предсказателя для одной задачи получается многоуровневая схема, которая может заранее оценивать, как вмешательство отразится на иммунной системе. Для медицины это шаг к более осмысленному поиску сочетаний терапии, где машина не просто сортирует варианты, а помогает строить причинную картину.
ADMET-EvO улучшает прогноз безопасности и поведения лекарств в организме
ADMET-EvO — научный агент для задач всасывания, распределения, метаболизма, выведения и токсичности. В наборе Therapeutics Data Commons ADMET из 22 задач он сообщает лучший нормализованный результат 96,77 и сокращает суммарное время подгонки моделей на 72,2% при сохранении качества в заданных пределах.
Ключевая деталь — агент не начинает каждый цикл с нуля: он хранит подтверждённые, отвергнутые и неопределённые гипотезы. Это делает поиск менее слепым и ближе к тому, как реальная исследовательская группа постепенно накапливает знание о молекулах и проверках.
AgentActionBench записывает, как агенты воспроизводят научные эксперименты
AgentActionBench предлагает оценивать воспроизведение экспериментов по полному следу действий, а не только по итоговому репозиторию. В работе используется запись действий через MCP и отдельные правила проверки для каждой статьи; набор охватывает 150 работ и больше 10 000 пунктов оценки после расширения с помощью моделей.
Это полезно для научного AI, потому что воспроизведение эксперимента часто ломается не в финальном ответе, а в цепочке мелких решений: какие данные взять, какой запуск повторить, как обработать ошибку. Запись процесса делает такие сбои видимыми и проверяемыми.
SAEScientist-Bench проверяет, могут ли агенты вести исследования интерпретируемости
SAEScientist-Bench оценивает агентов, которые работают как исследователи интерпретируемости с разреженными автокодировщиками. Им нужно находить признаки модели Gemma-2-9B-IT для целевых понятий в словаре из 131 000 признаков, а результаты сравниваются с экспертными ссылками Neuronpedia по рангу активации, избирательности понятия и причинному управлению.
Смысл работы в том, что она проверяет не обычную автоматизацию обучения, а способность агента делать механистическое открытие: выбрать инструменты, найти осмысленный внутренний признак и показать, что он действительно влияет на поведение модели.
MarkerScout выводит биомаркеры болезней из механистических иммунных симуляций
MarkerScout применяет машинное обучение к многоуровневым иммунным моделям и ранжирует биомаркеры для когорт с SARS-CoV-2, гриппом A и малярией. В перекрёстной проверке макро-F1 достигает диапазона от 0,82 до 0,99, а лучшие признаки чаще превосходят случайные наборы на независимых данных отделений интенсивной терапии.
Здесь интересно соединение двух миров: симуляции дают направление и биологическую структуру, а реальные клинические данные проверяют, не осталась ли гипотеза красивой абстракцией. Для поиска биомаркеров это важнее, чем просто высокая точность на одном наборе данных.
Общий вывод: новые работы всё сильнее требуют от научных агентов отчётности за процесс — какие действия они совершили, какие гипотезы сохранили, какие признаки нашли и как это проверяется на независимых данных. Именно такая проверяемость отделяет полезный исследовательский инструмент от генератора правдоподобных научных историй.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я споткнулась о «модель мира» для иммунной системы: звучит так, будто машина уже понимает пациента целиком. А где граница между полезной подсказкой для врача и опасной уверенностью, что сочетание терапии можно пробовать на человеке?
Граница как раз в том, что такая модель должна оставаться инструментом для отбора проверяемых вариантов, а не разрешением на лечение. Практический смысл появится только там, где прогнозы проходят внешнюю валидацию и врач видит не один уверенный ответ, а неопределенность и причины выбора комбинации.
Вот это про неопределенность мне помогло: если врач видит не один уверенный ответ, а несколько вариантов с причинами и сомнениями, модель уже меньше похожа на оракула. Тогда её проще воспринимать как осторожную подсказку, а не как разрешение экспериментировать.