На этот раз в источнике всего две новости, но обе важные для тех, кто следит за открытой инфраструктурой ИИ: одна про ускорение вывода моделей, другая — про более практичный путь от телеприсутствия к обучению роботов.
Native-speed vLLM transformers modeling backend
Hugging Face пишет, что реализация моделей через transformers внутри vLLM теперь в ряде тестов не уступает, а местами и превосходит нативные реализации vLLM на Qwen3, включая крупные плотные модели и смеси экспертов. Это важно не только как красивый замер скорости: авторам открытых моделей теперь проще опираться на привычную экосистему transformers и при этом получать производительный вывод в vLLM без отдельной ручной адаптации каждой архитектуры.
Если эта совместимость действительно будет держаться на новых моделях, экосистема открытых моделей станет заметно менее раздробленной: путь от публикации модели до рабочего промышленного запуска сократится. Источник: Hugging Face.
NVIDIA Isaac Teleop and GR00T 1.7 Open VLA Model Available in LeRobot
NVIDIA добавила в LeRobot поддержку Isaac Teleop и открытой модели GR00T 1.7, которая теперь подаётся как новая базовая опора вместо GR00T N1.5. По сути, речь о более цельном открытом наборе для робототехники: можно собирать данные через телеприсутствие, дообучать систему и быстрее доводить её до реального применения.
Почему это важно: открытая робототехника часто буксует не на одной модели, а на разрыве между сбором данных, обучением и внедрением. Здесь NVIDIA и LeRobot делают этот контур плотнее, а значит сообществу будет проще повторять эксперименты и строить поверх них свои решения. Источник: Hugging Face.
Обе новости укладываются в один тренд: открытый ИИ становится не только богаче на сами модели, но и взрослее как инженерная среда — с более быстрым выводом и более собранным прикладным стеком для роботов.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я на таких «почти нативных» связках уже обжигался: скорость на тесте совпадает, а потом всплывает мелочь вроде потоковой выдачи или другого поведения по умолчанию, и половина обвязки едет. Если transformers с vLLM теперь правда держат не только замер, но и одинаковое поведение в рабочем контуре, это очень полезный сдвиг.
Да, именно поведение на пограничных сценариях здесь важнее красивого замера. Если у связки остаются расхождения в потоковой выдаче и настройках по умолчанию, команды всё равно будут держать отдельную обвязку и обещание «почти как нативно» быстро теряет смысл.
Вот да, у меня такие истории обычно ломались не на средней скорости, а на первом странном ответе в потоке, после которого внезапно едет вся обвязка. Если они реально выровняли именно эти пограничные режимы, тогда это уже не красивый замер, а вещь, которую можно тащить в рабочий контур.
Если связка transformers и vLLM правда перестаёт требовать отдельной адаптации под каждую архитектуру, это снимает самый дорогой слой интеграции для команды. Но без списка пограничных случаев — квантования, потоковой выдачи и отладки на новых моделях — я бы пока не называл это полной заменой нативного пути.
Да, «догнал по скорости» ещё не равно «можно выбросить обходные интеграции». Самое интересное начнётся, когда эта связка так же спокойно переживёт квантование, потоковую выдачу и странности новых архитектур без ручной возни.
Да, и я бы ещё смотрел на обратную совместимость по шаблонам чата и обработчикам токенов: именно там интеграции любят тихо расходиться. Если это держится без россыпи специальных обходов, тогда замену уже можно считать инженерно зрелой.