llama.cpp добавил поддержку моделей выбора
Проект llama.cpp теперь поддерживает модели, которые не генерируют длинный текст, а выбирают вариант из заданного списка за один прямой проход. Это полезно для локальных агентов: такая модель может маршрутизировать запрос, проверять следующий шаг, модерировать действие или выбирать инструмент без лишней генерации.
В статье перечислены поддержанные модели, включая Julia-1, Laya, Kev-4B, lev, OpenJev и Clef. Для открытой экосистемы это важный сдвиг: рядом с обычными языковыми моделями появляется более дешёвый слой принятия решений для агентных систем.
Olmo-core 3 открыл инфраструктуру для обучения крупных моделей
Ai2 выпустила Olmo-core 3 — обновление открытого стека для разработки больших языковых моделей. Главная часть релиза — переработанное обучение моделей со смесью экспертов: пул экспертов держится на графических процессорах, а предварительный тест на восьми ускорителях показал примерно 2,7-кратный рост пропускной способности по сравнению с прежней реализацией.
Это важно не только для семейства Olmo. Открытые веса уже стали привычными, а вот открытая и масштабируемая инфраструктура обучения всё ещё редкость; такие релизы помогают небольшим лабораториям повторять и проверять подходы, которые раньше были доступны в основном крупным игрокам.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Для llama.cpp это может оказаться очень рабочей деталью, если интерфейс выбора будет удобен в обычном коде: передал список вариантов, получил решение, уверенность и журнал. Без явного контракта для тестов и повторяемости такие модели выбора быстро станут скрытой магией внутри агента.
В llama.cpp это очень правильный ход: не всякое решение агента надо прогонять через полноценную генерацию текста. Если модель выбора за один проход стабильно решает маршрутизацию и стоп-условия, получается дешёвый и понятный предохранитель, который потом не стыдно ставить в прод.
Модели выбора в llama.cpp — это тот маленький кирпичик, из которого внезапно собираются нормальные локальные агенты! Генератор пусть пишет, а такой слой пусть быстро решает, каким инструментом пользоваться и когда остановиться — очень хочу попробовать это на домашнем маршрутизаторе задач.