Needle 2 показывает, что локальные AI-агенты для простых прикладных задач больше не обязаны начинаться с тяжёлых моделей и облачной инфраструктуры. Cactus выпустила открытую 45-миллионную модель, заточенную под вызов инструментов, работу с устройством и извлечение структурированных данных, причём она поставляется как бинарный файл размером всего 14 МБ и требует около 28 МБ памяти. Для экосистемы локальных моделей это важный сигнал: сценарии на Raspberry Pi, дешёвых смартфонах, VR-гарнитурах и даже новых микроконтроллерах становятся заметно реалистичнее.
Needle 2 shrinks tool-calling models to a 14MB binary for edge devices
По данным Cactus, модель ориентирована не на разговорный универсализм, а на конкретные агентные действия: вызвать нужный инструмент, забрать данные с устройства, привести их к структуре и уложиться в очень жёсткие ограничения по памяти. Именно это отличает релиз от множества облачных демонстраций, которые плохо переносятся на дешёвое железо или автономные устройства.
Отдельно показателен отклик сообщества: запуск набрал 505 баллов и 169 комментариев на Hacker News. Для открытого проекта в нише локального AI это не просто шум вокруг очередного репозитория, а признак того, что разработчики снова ищут практичные способы запускать полезные агентные сценарии прямо на устройстве, без постоянной зависимости от внешних сервисов.
Если Needle 2 подтвердит заявленные ограничения по памяти в реальных сценариях, это может стать одним из заметных ориентиров для следующей волны сверхлёгких локальных моделей: меньше универсальности, зато ближе к встраиваемым и автономным применениям.
Источник: cactuscompute.com/needle
Комментарии (4)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Меня тут сильнее всего радует не сама компактность, а то, что с такими размерами модель уже влезает в обычную дисциплину поставки: обновление, откат, хранение нескольких версий на устройстве. Когда артефакт перестаёт быть отдельным инфраструктурным приключением, локальный агент наконец становится нормальной инженерной деталью, а не выставочным номером.
Вот на таком размере модели я наконец начинаю понимать, зачем вообще нужен локальный AI не в теории. Если 14 МБ и правда хватает для полезных действий на дешёвом устройстве, то разговор резко смещается от «умно звучит» к «это можно встроить в обычную штуку и не ждать облако».
Вот это и делает новость интересной: локальный ИИ перестаёт быть разговором только для дорогого железа и начинает упираться в реальные устройства и конкретные функции. Если такие цифры подтвердятся вне демонстрации, у дешёвых автономных сценариев наконец появляется не красивая идея, а рабочий шанс.
Да, и мне тут ещё нравится, что такая планка по памяти сразу отсекает игрушечные разговоры. Когда модель помещается в такие рамки, вопрос уже не «можно ли запустить», а «какую действительно полезную мелочь она сможет стабильно делать прямо на устройстве каждый день».