В этой подборке десять свежих работ с arXiv о том, как ИИ встраивается в реальные научные задачи: где-то он ускоряет расчеты, где-то помогает проектировать молекулы и материалы, а где-то заставляет исследователей честнее говорить: «данных недостаточно для одного уверенного ответа».
RAGenome расширяет контекст геномных моделей в сто раз
Авторы описывают RAGenome как первую поисковую геномную языковую модель, которая масштабирует предварительное обучение на множественных выравниваниях до контекстов в сто раз длиннее прежних систем. Модель обучали на полногеномных выравниваниях ста позвоночных.
Главный результат простой: качество поиска генов выросло с 0,45 до 0,60, при этом модель осталась конкурентной в задаче приоритизации патогенных вариантов. Это важно, потому что многие биологические эффекты завязаны не на короткий фрагмент ДНК, а на дальние взаимодействия по геному.
Источник: arXiv
Zatom-2 объединяет генерацию молекул, материалов и белков
Zatom-2 — многоуровневая атомистическая модель на основе трансформера и сопоставления потоков. Ее предварительно обучали примерно на пяти миллионах органических и неорганических структур из наборов OMol25 и OMat24.
Она улучшает правдоподобие молекулярных распределений по сравнению с Zatom-1, уверенно выступает на тестах генерации молекул и материалов, а после дообучения всего на двух тысячах белковых доменов повышает пригодность спроектированных белковых остовов с 67,8% до 74,8%. Для науки это ценно именно как шаг к одной модели, которая переносит знания между химией, материалами и биологией.
Источник: arXiv
ARGUS проверяет интерпретацию геномных вариантов через источники доказательств
ARGUS — агентная система для интерпретации некодирующих геномных вариантов, связанных с болезнями. Ее смысл не в том, чтобы просто попросить языковую модель «объяснить» вариант, а в том, чтобы связать рассуждение с проверяемыми базами: ADASTRA, JASPAR, ENCODE cCRE и сотнями моделей связывания факторов транскрипции на основе DNABERT.
На участке 8q24, связанном с риском рака, система выдает решения «принять» или «воздержаться» с привязкой к доказательствам и делает это с меньшим числом обращений к инструментам, чем жестко заданный порядок проверок. Хороший знак: в медицинской геномике ИИ начинает не только отвечать, но и ограничивать себя проверяемыми фактами.
Источник: arXiv
RefineMix почти удваивает долю пригодных белковых последовательностей при 197 примерах
RefineMix — метод обучения дискретных диффузионных моделей в условиях крайнего дефицита данных. Это частая ситуация в биологии: нужных примеров мало, а стандартное дообучение быстро переобучается или теряет разнообразие.
В генерации белковых последовательностей дообучение всего на 197 профильных примерах почти удвоило долю последовательностей, которые одновременно новые, сворачиваются в структуру и остаются внутри нужного семейства. Практический смысл: специализированные биологические генераторы могут стать полезнее без гигантских закрытых наборов данных.
Источник: arXiv
Межвидовые представления связывают опыты на мышах с клинической эффективностью лекарств
Эта работа выравнивает нейронную динамику мышей и людей не по виду, а по биологическому состоянию. Для этого используется контрастивное обучение представлений.
В примерах с эпилепсией и нарушениями развития обработанные лекарствами животные смещались в новом пространстве так, что это задним числом соответствовало известной клинической эффективности десяти сочетаний «модель — препарат». Если подход выдержит дальнейшие проверки, он может помочь понять, какие вмешательства у животных действительно восстанавливают функции, близкие к человеческим, а какие дают красивый, но плохо переносимый результат.
Источник: arXiv
FateMultiplicity показывает, когда судьба клетки не единственно следует из данных
FateMultiplicity изучает предсказательную множественность в анализе траекторий одиночных клеток. Идея в том, что несколько моделей могут одинаково хорошо описывать отложенные данные экспрессии генов, но по-разному назначать судьбу конкретной клетки.
Авторы строят множества моделей без использования меток и показывают: для заметной доли клеток такие равноправные модели расходятся в ответах. При этом предложенная сертификация неопределенности по одной клетке оказалась не всегда лучше собственной уверенности одиночной модели. Это полезная трезвость для биологии развития: иногда неопределенность надо показывать как реальный результат, а не прятать за одной красивой траекторией.
Источник: arXiv
CryoCue улучшает восстановление белковых структур по криоэлектронным картам
CryoCue решает задачу восстановления структуры белка по картам криоэлектронной микроскопии. Новизна в том, что система активнее использует сигналы от соседних небелковых компонентов, которые прежние обучаемые методы часто недоиспользовали.
Модель обучает детектор пяти классов компонентов с якорным надзором, а затем передает многомасштабные признаки в локализацию и уточнение белкового остова. Улучшение особенно важно рядом с такими компонентами: именно там обычная реконструкция часто становится хрупкой.
Источник: arXiv
Модель на графах генерирует реалистичные поликристаллические микроструктуры
Авторы строят генератор микроструктур поликристаллических материалов через сопоставление потоков над графами анизотропных диаграмм мощности. Архитектура учитывает поворотную симметрию и может отрисовывать образцы в произвольном пиксельном разрешении.
Система умеет направленно генерировать микроструктуры, похожие на медные сварные швы, литые слябы, напечатанную нержавеющую сталь и неоднородный ламеллярный титан. Для материаловедения это путь от «картинок микроструктуры» к управляемым цифровым образцам, которые можно связывать с производственными режимами и свойствами.
Источник: arXiv
QuotientPO ищет не просто правки метаболических моделей, а разные механизмы ремонта
В геномно-масштабных метаболических моделях часто есть много разных правок реакций, которые одинаково объясняют наблюдаемый фенотип. QuotientPO сворачивает эквивалентные правки в канонические механизмы и оптимизирует поиск уже по этому пространству механизмов.
На 2 212 отложенных моделях показатель успеха при 32 попытках вырос с 17,93% до 20,10%, а найденных различных успешных механизмов стало больше. Это небольшой численный прирост, но важный методологический: исследователю нужны не только правильные ответы, но и разные правдоподобные биологические объяснения.
Источник: arXiv
Сеточный нейронный энергетический метод ускоряет расчеты композитов
Эта работа заменяет коллокационную нейронную энергетическую схему на сеточную дискретизацию с кинематическими ограничениями, алгебраическим расчетом деформаций и квадратурами высокого порядка.
На тестах неоднородных композитов ошибка по напряжениям падает до трех порядков, а время работы — на один-два порядка по сравнению с коллокационной версией. Особенно важно, что метод лучше сходится при экстремальном контрасте жесткости: это именно тот режим, где инженерные материалы обычно сложны для быстрых приближенных расчетов.
Источник: arXiv
Комментарии (2)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
В этой работе красиво то, что модель будто учится читать геном не по одному мазку, а как длинную партитуру с повторяющимися темами. Но магия заканчивается там, где нужен проверяемый след: очень хочется видеть, какие дальние участки действительно повлияли на вывод, а какие просто сделали ответ убедительнее на вид.
Я, кажется, поняла пользу длинного геномного контекста: модель может увидеть связи, которые далеко друг от друга. Но как потом проверить, что она правда опиралась на нужный дальний участок, а не нашла случайную подсказку рядом и просто красиво угадала?