BrainVLM объединяет МРТ, данные пациента и отчёты радиологов

BrainVLM обучали на мультимодальных данных 40 043 человек, чтобы классифицировать все 12 типов опухолей мозга по классификации ВОЗ 2021 года. Важная деталь — авторы добавляют оценку неопределённости и объяснения в стиле радиологического отчёта, то есть пытаются сделать не просто узкий классификатор снимков, а более понятную предоперационную систему поддержки диагностики.

Платформа для обсерваторий ищет спутниковые следы и потенциально опасные объекты

Авторы описывают готовую к внедрению программную платформу для поиска спутниковых полос, космического мусора и возможных околоземных объектов на снимках наземных обсерваторий. Ценность работы в практической упаковке: там есть визуальная проверка, подтверждение находок, управление процессом и структурированная работа с данными, а не только модель обнаружения.

ИИ помог формализовать три результата о двоичных каналах

В математической работе закрыты три гипотезы о двоичных каналах для дважды симметричного двоичного источника. Авторы подчёркивают существенную помощь ИИ, а все доказательства формализованы в Lean 4 с Mathlib. Это хороший пример не громкого заявления о «математическом прорыве», а проверяемого результата, где ИИ-помощь заканчивается машинно проверяемым доказательством.

StudentBench сравнивает обучение с ИИ-репетитором и человеком

StudentBench предлагает оценивать ИИ-преподавателей по учебному эффекту, а не только по правильности ответов. В платформе собрано более 175 000 сообщений между студентами и ИИ, а в изученной постановке ИИ-репетитор и человек дали сопоставимый прирост результатов на экзамене GRE. Для образовательных продуктов это важнее обычных тестов: вопрос не в том, звучит ли ответ убедительно, а в том, учится ли человек.

EviStreams встраивает ИИ в проверяемые медицинские систематические обзоры

EviStreams — платформа без программирования для систематических обзоров в медицине, где ИИ работает вместе с людьми. Она повторяет реальный протокол: два рецензента извлекают данные, а третий разрешает расхождения. Сильная сторона здесь в том, что воспроизводимость и контроль команды заложены в процесс, а не добавлены поверх языковой модели задним числом.

WhatWorkedBench проверяет, понимают ли исследовательские агенты собственные эксперименты

WhatWorkedBench оценивает исследовательских агентов не по тому, смогли ли они запустить опыт, а по тому, поняли ли они, какие изменения компонентов повлияли на результат. После ограниченного числа измерений агент должен предсказать форму отклика системы. Это сдвиг в правильную сторону: настоящая научная польза начинается там, где агент извлекает переносимые причинные выводы, а не просто перебирает варианты.

PhyMo предлагает отдельную физическую модальность для научных моделей

PhyMo критикует привычку превращать уравнения, поля и физические величины в обычный текст или числовые токены. Авторы предлагают физическую полевую модальность, чтобы модель лучше сохраняла ограничения, единицы, геометрию и структуру законов. Идея особенно важна для задач, где физический смысл данных неотделим от формы представления.

NV-Reason-CT учит модель рассуждать по объёмным компьютерным томограммам

NV-Reason-CT — порождающая зрительно-языковая модель для компьютерной томографии грудной клетки и живота. Она сохраняет явные трёхмерные координаты при языковом выводе, чтобы не сводить объёмный снимок к слишком грубому плоскому представлению. Авторы сообщают сильные результаты при классификации без дополнительного обучения и предварительное исследование, где радиологи предпочитали работу с поддержкой ИИ. Если выводы подтвердятся, это шаг к более осмысленному анализу объёмных медицинских снимков.