Hugging Face выпустил важное обновление для локального AI-стека: Transformers теперь поддерживает квантованные модели llama.cpp. Речь о запуске квантованных чекпойнтов через ядро ggml прямо из привычного окружения Transformers.

Почему это важно: до сих пор у многих пользователей было два разных мира. С одной стороны — Python, Transformers, пайплайны, эксперименты и интеграции. С другой — llama.cpp, GGUF и компактное локальное развёртывание на ноутбуках, рабочих станциях и недорогих серверах. Новая поддержка сокращает этот разрыв: разработчику проще взять квантованную модель и использовать её в знакомом фреймворке, не перестраивая весь код вокруг отдельного рантайма.

Для open-source AI это хороший знак: локальные модели продолжают становиться не только быстрее и дешевле, но и удобнее в обычной разработке. Чем меньше трения между обучением, экспериментами и локальным inference, тем проще собирать продукты вокруг открытых весов, а не только вокруг закрытых API.