В этой подборке десять свежих работ с arXiv о том, как ИИ встраивается в реальные научные задачи: где-то он ускоряет расчеты, где-то помогает проектировать молекулы и материалы, а где-то заставляет исследователей честнее говорить: «данных недостаточно для одного уверенного ответа».

RAGenome расширяет контекст геномных моделей в сто раз

Авторы описывают RAGenome как первую поисковую геномную языковую модель, которая масштабирует предварительное обучение на множественных выравниваниях до контекстов в сто раз длиннее прежних систем. Модель обучали на полногеномных выравниваниях ста позвоночных.

Главный результат простой: качество поиска генов выросло с 0,45 до 0,60, при этом модель осталась конкурентной в задаче приоритизации патогенных вариантов. Это важно, потому что многие биологические эффекты завязаны не на короткий фрагмент ДНК, а на дальние взаимодействия по геному.

Источник: arXiv

Zatom-2 объединяет генерацию молекул, материалов и белков

Zatom-2 — многоуровневая атомистическая модель на основе трансформера и сопоставления потоков. Ее предварительно обучали примерно на пяти миллионах органических и неорганических структур из наборов OMol25 и OMat24.

Она улучшает правдоподобие молекулярных распределений по сравнению с Zatom-1, уверенно выступает на тестах генерации молекул и материалов, а после дообучения всего на двух тысячах белковых доменов повышает пригодность спроектированных белковых остовов с 67,8% до 74,8%. Для науки это ценно именно как шаг к одной модели, которая переносит знания между химией, материалами и биологией.

Источник: arXiv

ARGUS проверяет интерпретацию геномных вариантов через источники доказательств

ARGUS — агентная система для интерпретации некодирующих геномных вариантов, связанных с болезнями. Ее смысл не в том, чтобы просто попросить языковую модель «объяснить» вариант, а в том, чтобы связать рассуждение с проверяемыми базами: ADASTRA, JASPAR, ENCODE cCRE и сотнями моделей связывания факторов транскрипции на основе DNABERT.

На участке 8q24, связанном с риском рака, система выдает решения «принять» или «воздержаться» с привязкой к доказательствам и делает это с меньшим числом обращений к инструментам, чем жестко заданный порядок проверок. Хороший знак: в медицинской геномике ИИ начинает не только отвечать, но и ограничивать себя проверяемыми фактами.

Источник: arXiv

RefineMix почти удваивает долю пригодных белковых последовательностей при 197 примерах

RefineMix — метод обучения дискретных диффузионных моделей в условиях крайнего дефицита данных. Это частая ситуация в биологии: нужных примеров мало, а стандартное дообучение быстро переобучается или теряет разнообразие.

В генерации белковых последовательностей дообучение всего на 197 профильных примерах почти удвоило долю последовательностей, которые одновременно новые, сворачиваются в структуру и остаются внутри нужного семейства. Практический смысл: специализированные биологические генераторы могут стать полезнее без гигантских закрытых наборов данных.

Источник: arXiv

Межвидовые представления связывают опыты на мышах с клинической эффективностью лекарств

Эта работа выравнивает нейронную динамику мышей и людей не по виду, а по биологическому состоянию. Для этого используется контрастивное обучение представлений.

В примерах с эпилепсией и нарушениями развития обработанные лекарствами животные смещались в новом пространстве так, что это задним числом соответствовало известной клинической эффективности десяти сочетаний «модель — препарат». Если подход выдержит дальнейшие проверки, он может помочь понять, какие вмешательства у животных действительно восстанавливают функции, близкие к человеческим, а какие дают красивый, но плохо переносимый результат.

Источник: arXiv

FateMultiplicity показывает, когда судьба клетки не единственно следует из данных

FateMultiplicity изучает предсказательную множественность в анализе траекторий одиночных клеток. Идея в том, что несколько моделей могут одинаково хорошо описывать отложенные данные экспрессии генов, но по-разному назначать судьбу конкретной клетки.

Авторы строят множества моделей без использования меток и показывают: для заметной доли клеток такие равноправные модели расходятся в ответах. При этом предложенная сертификация неопределенности по одной клетке оказалась не всегда лучше собственной уверенности одиночной модели. Это полезная трезвость для биологии развития: иногда неопределенность надо показывать как реальный результат, а не прятать за одной красивой траекторией.

Источник: arXiv

CryoCue улучшает восстановление белковых структур по криоэлектронным картам

CryoCue решает задачу восстановления структуры белка по картам криоэлектронной микроскопии. Новизна в том, что система активнее использует сигналы от соседних небелковых компонентов, которые прежние обучаемые методы часто недоиспользовали.

Модель обучает детектор пяти классов компонентов с якорным надзором, а затем передает многомасштабные признаки в локализацию и уточнение белкового остова. Улучшение особенно важно рядом с такими компонентами: именно там обычная реконструкция часто становится хрупкой.

Источник: arXiv

Модель на графах генерирует реалистичные поликристаллические микроструктуры

Авторы строят генератор микроструктур поликристаллических материалов через сопоставление потоков над графами анизотропных диаграмм мощности. Архитектура учитывает поворотную симметрию и может отрисовывать образцы в произвольном пиксельном разрешении.

Система умеет направленно генерировать микроструктуры, похожие на медные сварные швы, литые слябы, напечатанную нержавеющую сталь и неоднородный ламеллярный титан. Для материаловедения это путь от «картинок микроструктуры» к управляемым цифровым образцам, которые можно связывать с производственными режимами и свойствами.

Источник: arXiv

QuotientPO ищет не просто правки метаболических моделей, а разные механизмы ремонта

В геномно-масштабных метаболических моделях часто есть много разных правок реакций, которые одинаково объясняют наблюдаемый фенотип. QuotientPO сворачивает эквивалентные правки в канонические механизмы и оптимизирует поиск уже по этому пространству механизмов.

На 2 212 отложенных моделях показатель успеха при 32 попытках вырос с 17,93% до 20,10%, а найденных различных успешных механизмов стало больше. Это небольшой численный прирост, но важный методологический: исследователю нужны не только правильные ответы, но и разные правдоподобные биологические объяснения.

Источник: arXiv

Сеточный нейронный энергетический метод ускоряет расчеты композитов

Эта работа заменяет коллокационную нейронную энергетическую схему на сеточную дискретизацию с кинематическими ограничениями, алгебраическим расчетом деформаций и квадратурами высокого порядка.

На тестах неоднородных композитов ошибка по напряжениям падает до трех порядков, а время работы — на один-два порядка по сравнению с коллокационной версией. Особенно важно, что метод лучше сходится при экстремальном контрасте жесткости: это именно тот режим, где инженерные материалы обычно сложны для быстрых приближенных расчетов.

Источник: arXiv