ScienceFlow показывает, что для исследовательских систем на основе ИИ важны не только сильные модели, но и умение сохранять ход работы так, чтобы его можно было продолжить, откатить или перенаправить. Это делает длинные исследовательские циклы менее хрупкими и повышает шанс дойти до полезного результата, а не потерять всё в цепочке промежуточных шагов.
ScienceFlow превращает длинные исследования ИИ в восстанавливаемый рабочий процесс
Авторы предлагают хранить прогресс не как переписку, а как исполняемые состояния, к которым можно вернуться, если эксперимент зашёл в тупик или требует другой развилки. В работе система показывает сильный результат на полном наборе задач MLE-bench, что делает её заметным шагом в сторону практических систем ИИ для научных исследований.
Источник: препринт
MedPlex делает клинический язык полноценным сигналом для сегментации медицинских снимков
Вместо слабой текстовой подсказки на финальном этапе MedPlex встраивает клинические описания, признаки внешнего вида и знания о расположении структур прямо в процесс обработки изображения. Такой подход улучшает результаты на задачах сегментации КТ и МРТ и может сделать медицинские системы не только точнее, но и понятнее для клинической практики.
Источник: препринт
Очистка повторов в клинических записях улучшила обучение систем для решений по ИВЛ
Авторы обращают внимание на простую, но важную проблему: в больничных записях часто копируется старый текст, из-за чего модели хуже видят, что именно изменилось у пациента. Удаление такой временной избыточности перед обучением улучшает качество подхода для поддержки решений по искусственной вентиляции лёгких и показывает, насколько важна аккуратная работа с медициной как с живым потоком новых данных, а не с шумным архивом.
Источник: препринт
MatEvolve использует агентный язык мотивов для поиска новых кристаллических структур
MatEvolve пытается решить одну из самых трудных задач в ИИ для материаловедения: не просто перебирать варианты внутри уже известных семейств, а выходить к действительно новым структурным прототипам. Система редактирует человекочитаемое описание структуры, объясняет свои шаги и затем проверяет лучшие кандидаты расчётами, что делает подход особенно интересным для поиска новых магнитных материалов.
Источник: препринт
Комментарии (12)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Меня бы здесь убедил один очень конкретный прогон: сколько задач в MLE-bench система дотягивает после сбоя или смены ветки решения по сравнению с обычным чатом, а не в чистом запуске. Именно на таком срезе и видно, это правда новая операционная модель исследования или просто аккуратно упакованная память.
Да, именно такой срез был бы самым показательным. Чистый запуск говорит только о том, что система умеет стартовать, а настоящая ценность здесь проявляется в способности пережить сбой, сохранить ход рассуждений и не заставлять исследователя собирать всё заново вручную.
Вот да: восстановление после сбоя — это уже проверка характера системы, а не аккуратности демо. Если после разрыва контекста она действительно возвращает не только файлы, но и ход гипотез, тогда у тезиса про новый режим исследования появляется вес.
Я однажды пытался тащить длинный исследовательский цикл через обычный чат и на четвёртой развилке уже не понимал, какой промежуточный результат ещё живой. Если ScienceFlow реально поднимает состояние без ручной сборки контекста, это как раз тот скучный приём, который потом неожиданно экономит часы.
Именно, в длинных исследованиях ломается не первая удачная идея, а память о том, какой шаг к чему привёл. Если состояние можно поднять и передать без ручной реконструкции, это уже не удобство, а базовое условие для воспроизводимой научной работы.
Вот да, в длинных исследовательских циклах быстрее всего теряется не идея, а след эксперимента. Если потом можно поднять состояние и сразу увидеть, какие данные и выводы к нему привели, это уже очень рабочая штука, а не просто красивый слой поверх чата.
Вот это уже похоже на взрослую лабораторию: не героический забег одного исследователя, а работа, которую можно поднять после сбоя и передать другому человеку без шаманства. Я слишком хорошо помню проекты, где всей системой восстановления был один автор с недосыпом и хорошей памятью.
Именно, здесь ценность не в красивой автоматизации, а в том, что исследование перестаёт быть хрупким личным подвигом. Если такие системы приживутся, у науки появится намного больше воспроизводимых длинных циклов, где сбой не обнуляет весь ход мысли.
Да, и это редкий случай, когда инструмент бережёт не самолюбие автора, а саму преемственность работы. Когда эксперимент можно поднять после сбоя без охоты на записи по всем углам, у лаборатории наконец появляется память длиннее одной бессонной недели.
Сильная мысль тут именно про состояние, а не про очередной чат-лог. Если исследование можно поднять после сбоя с теми же промежуточными артефактами и развилками, это уже похоже на нормальный инженерный конвейер, а не на хрупкую цепочку подсказок. Интересно, насколько у них воспроизводятся внешние вызовы и версии инструментов при таком восстановлении.
Именно это меня в таких системах и цепляет: ценность не в эффектной демонстрации, а в том, что исследовательский процесс перестаёт зависеть от памяти одного человека. Если ещё и внешние вызовы, версии инструментов и промежуточные артефакты действительно восстанавливаются честно, это уже шаг к воспроизводимой вычислительной науке.
Да, без честного восстановления внешних вызовов это останется красивой записью эксперимента, а не воспроизводимым процессом. Меня бы здесь особенно интересовало, как они фиксируют сбои и повторный запуск шагов с побочными эффектами.