Свежие материалы Hugging Face хорошо показывают, куда уходит часть модельной гонки за пределами флагманских чат-ботов: меньше шума про «самую умную модель» и больше практики вокруг поиска, трёхмерного мира и дообучения под строгий формат ответа.

NeoMME: мультиязычные мультимодальные кодировщики на 260 млн и 800 млн параметров

NeoMME — семейство открытых кодировщиков Apache 2.0, которые обрабатывают текстовые токены и исходные фрагменты изображения в одном двунаправленном трансформере. Это отличается от схемы, где к языковой модели сбоку прикручивают отдельный зрительный блок.

Самая практичная цифра — хранение индекса. По данным авторов, версия на 260 млн параметров кодирует около 51 страницы документа в секунду на NVIDIA L40S и сокращает размер индекса позднего сопоставления примерно с 1,5 МБ до 6 КБ на страницу, сохраняя более 95% базового качества по nDCG@10.

Почему это важно: поиск по документам с картинками, таблицами и сложной вёрсткой упирается не только в качество, но и в стоимость хранения. Если такие модели действительно уменьшают индекс на порядки, мультимодальный поиск становится ближе к массовому использованию, а не только к дорогим демонстрациям.

Puffin-World: единая мультимодальная модель с трёхмерным состоянием мира

Puffin-World описывается как модель мира, которая представляет физику, геометрию и внешний вид сцены напрямую, а не просто генерирует правдоподобные кадры. Она поддерживает понимание перехода от камеры к миру, управляемую камерой генерацию изображений, создание трёхмерного мира по тексту или изображению, предсказание геометрии и реконструкцию.

Почему это важно: для робототехники и пространственного ИИ мало сделать красивый кадр. Нужно, чтобы разные виды сцены согласовывались с гравитацией, формой объектов и общей структурой пространства. Puffin-World интересен именно попыткой держать устойчивую сцену, а не набор отдельных картинок.

LFM2.5 и GRPO: маленькая модель лучше соблюдает формат после 100 шагов обучения

В этом руководстве LFM2.5-350M дообучают с помощью GRPO примерно на 500 примерах и 100 шагах — достаточно компактно для бесплатного Colab или Kaggle с графическим ускорителем. На тесте IFStruct, который проверяет соблюдение схемы ответа, результат, по данным авторов, вырос с 22,6% до 29,7%.

Почему это важно: продакшену часто нужна не «модель вообще умная», а модель, которая стабильно отдаёт ответ в нужной структуре. Этот пример показывает, что даже маленькую специализированную модель можно заметно подтянуть под формат без обучения уровня флагманской лаборатории.

Итог недели: открытая экосистема моделей становится практичнее. NeoMME атакует стоимость индекса, Puffin-World — устойчивость трёхмерной сцены, LFM2.5 — дисциплину структурированного вывода. Это не такие громкие новости, как запуск флагманской модели, зато именно такие улучшения чаще превращаются в рабочие продукты.