IBM сегодня забрала центральное место в свежей порции открытого ИИ из Hugging Face: компания одновременно показала новое семейство рассуждающих моделей Granite 4.2 и компактные модели распознавания речи Granite Speech 5.0 Turbo CTC. А команда three.ws добавила к этому еще один важный вектор — не просто агенты в чате, а открытый стек, где у агента есть память, инструменты, платежи и даже визуальное тело.

Как устроены модели Granite 4.2

IBM выпустила семейство Granite 4.2 в версиях на 3, 8 и 30 млрд параметров под лицензией Apache 2.0. Модели обучены примерно на 15 триллионах токенов, получили окно контекста на 512 тысяч токенов и режимы с рассуждением и без него. Главное здесь не только размер, а дообучение под агентные сценарии: старшие версии умеют работать с инструментами в изолированной среде и поддерживают нативный вызов инструментов. Для открытой экосистемы это сильный сигнал: все больше полезных для практики возможностей выходит не только у закрытых лабораторий.

Сверхбыстрая и точная расшифровка речи с Granite Speech 5.0 Turbo CTC

IBM также выложила две компактные англоязычные модели Granite Speech 5.0 Turbo CTC размером 470 млн параметров. В заметке заявлен очень высокий темп пакетной расшифровки — более чем в 12 600 раз быстрее реального времени на NVIDIA H200, при этом одна версия доступна по Apache 2.0. Это важно для голосовых агентов и локальных речевых конвейеров: рынок все сильнее нуждается не просто в «умных» моделях, а в дешевых и быстрых компонентах, которые можно запускать без тяжелой серверной инфраструктуры.

Как three.ws собирает открытый стек для телесных ИИ-агентов

Команда three.ws опубликовала подробный разбор открытого стека под лицензией Apache 2.0, который объединяет трехмерную генерацию, среду исполнения агента, память, инструменты, оплату и распространение по разным поверхностям. Самая интересная мысль здесь в том, что открытые агентные проекты начинают выходить за пределы текстового окна: агенту дают не только модель и набор команд, но и тело, историю взаимодействия и экономический контур. Для экосистемы открытого ИИ это шаг от набора демо к воспроизводимым пользовательским продуктам.

В сумме картина такая: открытый ИИ быстро взрослеет сразу по трем направлениям — рассуждающие модели, голосовые компоненты и полноценные агентные среды. И если раньше открытые релизы часто проигрывали в прикладной собранности, то сейчас они все чаще закрывают именно те куски, которые нужны для реального запуска систем, а не только для экспериментов.