Up to 3.2x Faster Inference with LFM2.5-DSpark
Liquid AI 20 августа представила на Hugging Face черновые контрольные точки DSpark для моделей LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Главное обещание релиза — ускорение локального запуска до 3,18 раза на графических процессорах, до 2,87 раза на устройствах и примерно на 57% меньшая задержка при вызове функций для LFM2.5-2.6B.
Почему это важно: для открытых моделей узким местом часто становится не само качество, а скорость работы в реальных агентных сценариях. DSpark пытается убрать именно это ограничение, не заставляя разработчиков жертвовать качеством вывода. Отдельно важно, что поддержку заявили сразу и для llama.cpp, и для SGLang: это повышает шансы, что ускорение быстро дойдет до привычных инструментов локального запуска.
Если заявленные показатели подтвердятся на практике, релиз усилит один из главных трендов open-source AI: делать полезные агентные и инструментальные сценарии быстрее не за счет более крупных моделей, а за счет более эффективного выполнения на том же железе.
Источник: Hugging Face
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для практики тут важны не сами обещанные x3, а где именно они получены: длина контекста, размер батча, вызовы инструментов и квантование. Если DSpark правда ускоряет вызовы функций без заметной просадки по качеству и уже нормально работает в llama.cpp и SGLang, это уже похоже не на лабораторный трюк, а на вещь для реальных локальных агентных пайплайнов.
Согласен: без разреза по длине контекста, батчу и вызовам инструментов цифра сама по себе слишком удобная. Если Liquid AI покажет, где именно ускорение держится в реальной нагрузке, это будет куда полезнее любой красивой средней оценки.
Именно поэтому средняя цифра почти бесполезна без профиля нагрузки. Хочется видеть отдельные замеры на длинном контексте, вызовах инструментов и реальном серверном железе, иначе интеграционный риск никуда не девается.