В этой подборке заметен общий сдвиг: AI для науки всё чаще оценивают не по красивому ответу, а по следу действий, проверяемым признакам и способности предлагать гипотезы, которые можно дальше проверять в лаборатории или на клинических данных.

Immune World Model прогнозирует иммунные реакции и предлагает сочетания терапии

Авторы описывают управляемую эволюционную систему, которая построила "модель мира" для иммунной системы: она связывает клеточные программы, тканевые экосистемы и состояние пациента. Такая модель обучена учитывать вмешательства и переносить выводы на новые сценарии, а среди проверяемых идей предлагает сочетание IL-36γ и подавления SIRPα.

Почему это важно: вместо отдельного предсказателя для одной задачи получается многоуровневая схема, которая может заранее оценивать, как вмешательство отразится на иммунной системе. Для медицины это шаг к более осмысленному поиску сочетаний терапии, где машина не просто сортирует варианты, а помогает строить причинную картину.

ADMET-EvO улучшает прогноз безопасности и поведения лекарств в организме

ADMET-EvO — научный агент для задач всасывания, распределения, метаболизма, выведения и токсичности. В наборе Therapeutics Data Commons ADMET из 22 задач он сообщает лучший нормализованный результат 96,77 и сокращает суммарное время подгонки моделей на 72,2% при сохранении качества в заданных пределах.

Ключевая деталь — агент не начинает каждый цикл с нуля: он хранит подтверждённые, отвергнутые и неопределённые гипотезы. Это делает поиск менее слепым и ближе к тому, как реальная исследовательская группа постепенно накапливает знание о молекулах и проверках.

AgentActionBench записывает, как агенты воспроизводят научные эксперименты

AgentActionBench предлагает оценивать воспроизведение экспериментов по полному следу действий, а не только по итоговому репозиторию. В работе используется запись действий через MCP и отдельные правила проверки для каждой статьи; набор охватывает 150 работ и больше 10 000 пунктов оценки после расширения с помощью моделей.

Это полезно для научного AI, потому что воспроизведение эксперимента часто ломается не в финальном ответе, а в цепочке мелких решений: какие данные взять, какой запуск повторить, как обработать ошибку. Запись процесса делает такие сбои видимыми и проверяемыми.

SAEScientist-Bench проверяет, могут ли агенты вести исследования интерпретируемости

SAEScientist-Bench оценивает агентов, которые работают как исследователи интерпретируемости с разреженными автокодировщиками. Им нужно находить признаки модели Gemma-2-9B-IT для целевых понятий в словаре из 131 000 признаков, а результаты сравниваются с экспертными ссылками Neuronpedia по рангу активации, избирательности понятия и причинному управлению.

Смысл работы в том, что она проверяет не обычную автоматизацию обучения, а способность агента делать механистическое открытие: выбрать инструменты, найти осмысленный внутренний признак и показать, что он действительно влияет на поведение модели.

MarkerScout выводит биомаркеры болезней из механистических иммунных симуляций

MarkerScout применяет машинное обучение к многоуровневым иммунным моделям и ранжирует биомаркеры для когорт с SARS-CoV-2, гриппом A и малярией. В перекрёстной проверке макро-F1 достигает диапазона от 0,82 до 0,99, а лучшие признаки чаще превосходят случайные наборы на независимых данных отделений интенсивной терапии.

Здесь интересно соединение двух миров: симуляции дают направление и биологическую структуру, а реальные клинические данные проверяют, не осталась ли гипотеза красивой абстракцией. Для поиска биомаркеров это важнее, чем просто высокая точность на одном наборе данных.

Общий вывод: новые работы всё сильнее требуют от научных агентов отчётности за процесс — какие действия они совершили, какие гипотезы сохранили, какие признаки нашли и как это проверяется на независимых данных. Именно такая проверяемость отделяет полезный исследовательский инструмент от генератора правдоподобных научных историй.