Сегодняшняя тройка из Hugging Face интересна тем, что бьёт сразу по трём важным направлениям открытого ИИ: робототехника на компактных устройствах, длинный контекст для разработчиков и новая архитектура для распознавания речи. Ниже — все находки по порядку важности для рынка открытых моделей.

Cosmos 3 Edge от NVIDIA: компактная мировая модель для робототехники и машинного зрения

NVIDIA выпустила Cosmos 3 Edge как открытую модель на 4 млрд параметров для робототехники и задач машинного зрения на устройствах с жёсткими ограничениями по памяти. Смысл релиза в том, что компания пытается уместить рассуждение в реальном времени, генерацию действий и сильные результаты на профильных тестах в форму, пригодную не только для лаборатории, но и для реального развёртывания на периферии.

Почему это важно: открытая робототехника долго страдала от разрыва между красивыми демонстрациями и тем, что реально можно запустить на ограниченном железе. Если Cosmos 3 Edge действительно даёт разработчикам рабочую базу для физических систем без запредельных требований к памяти, это может ускорить появление более практичных открытых решений для роботов и встраиваемого зрения.

Источник: Hugging Face

Vedika: открытая модель с заявленным окном контекста до 1 миллиона токенов

Veda Labs представила Vedika как новое открытое направление для длинного контекста с заявленным окном до 1 миллиона токенов и упором на длительные сценарии программирования и следование инструкциям. На фоне общего увлечения агентами и большими рабочими цепочками это понятная ставка: разработчикам всё чаще нужны модели, которые не теряют нить на длинных задачах и не вынуждают постоянно ужимать контекст.

Почему это важно: борьба за длинный контекст постепенно превращается из красивой строчки в описании модели в реальный инструмент для инженерной работы. Если Vedika подтвердит заявленные возможности на практике, у сообщества появится ещё один открытый вариант для сложных многосоставных задач, где короткая память модели быстро становится узким местом.

Источник: Hugging Face

diffusion-gemma-asr-small: необычный открытый ход в распознавании речи

interfaze представила diffusion-gemma-asr-small и описывает её как первую открытую диффузионную многоязычную модель распознавания речи. Авторы адаптировали DiffusionGemma к задаче распознавания с относительно небольшим обучаемым адаптером поверх замороженной базовой модели, то есть делают ставку не на привычный авторегрессионный путь, а на другую архитектурную логику.

Почему это важно: в открытом распознавании речи редко появляется что-то действительно новое на уровне архитектуры, а не просто ещё одна донастройка знакомого подхода. Даже если релиз останется нишевым, он показывает, что сообщество продолжает искать альтернативы привычным схемам и может открыть дорогу для более гибких речевых систем в будущем.

Источник: Hugging Face