Hugging Face добавил в Transformers поддержку квантованных моделей llama.cpp через ядро ggml. Для локальных LLM это важный мост между привычным Python-стеком Transformers и компактными форматами развёртывания, которые используют пользователи GGUF.
На Hacker News обсуждают Ghost Vessel — проект, который показывает, как агентные сценарии можно строить вокруг локальных LLM без обязательной зависимости от облачных API. История важна как индикатор устойчивого спроса на локальные, более управляемые и приватные инструменты для AI-автоматизации.
В свежем дайджесте open-source AI — мультимодальная модель NVIDIA для точной локализации объектов, компактная модель HRM-Text-1B для рассуждений, линейка Mellum 2 от JetBrains для задач разработки и потоковая ASR-модель Nemotron 3.5 для голосовых сценариев.