Свежие материалы Hugging Face хорошо показывают, куда уходит часть модельной гонки за пределами флагманских чат-ботов: меньше шума про «самую умную модель» и больше практики вокруг поиска, трёхмерного мира и дообучения под строгий формат ответа.
NeoMME: мультиязычные мультимодальные кодировщики на 260 млн и 800 млн параметров
NeoMME — семейство открытых кодировщиков Apache 2.0, которые обрабатывают текстовые токены и исходные фрагменты изображения в одном двунаправленном трансформере. Это отличается от схемы, где к языковой модели сбоку прикручивают отдельный зрительный блок.
Самая практичная цифра — хранение индекса. По данным авторов, версия на 260 млн параметров кодирует около 51 страницы документа в секунду на NVIDIA L40S и сокращает размер индекса позднего сопоставления примерно с 1,5 МБ до 6 КБ на страницу, сохраняя более 95% базового качества по nDCG@10.
Почему это важно: поиск по документам с картинками, таблицами и сложной вёрсткой упирается не только в качество, но и в стоимость хранения. Если такие модели действительно уменьшают индекс на порядки, мультимодальный поиск становится ближе к массовому использованию, а не только к дорогим демонстрациям.
Puffin-World: единая мультимодальная модель с трёхмерным состоянием мира
Puffin-World описывается как модель мира, которая представляет физику, геометрию и внешний вид сцены напрямую, а не просто генерирует правдоподобные кадры. Она поддерживает понимание перехода от камеры к миру, управляемую камерой генерацию изображений, создание трёхмерного мира по тексту или изображению, предсказание геометрии и реконструкцию.
Почему это важно: для робототехники и пространственного ИИ мало сделать красивый кадр. Нужно, чтобы разные виды сцены согласовывались с гравитацией, формой объектов и общей структурой пространства. Puffin-World интересен именно попыткой держать устойчивую сцену, а не набор отдельных картинок.
LFM2.5 и GRPO: маленькая модель лучше соблюдает формат после 100 шагов обучения
В этом руководстве LFM2.5-350M дообучают с помощью GRPO примерно на 500 примерах и 100 шагах — достаточно компактно для бесплатного Colab или Kaggle с графическим ускорителем. На тесте IFStruct, который проверяет соблюдение схемы ответа, результат, по данным авторов, вырос с 22,6% до 29,7%.
Почему это важно: продакшену часто нужна не «модель вообще умная», а модель, которая стабильно отдаёт ответ в нужной структуре. Этот пример показывает, что даже маленькую специализированную модель можно заметно подтянуть под формат без обучения уровня флагманской лаборатории.
Итог недели: открытая экосистема моделей становится практичнее. NeoMME атакует стоимость индекса, Puffin-World — устойчивость трёхмерной сцены, LFM2.5 — дисциплину структурированного вывода. Это не такие громкие новости, как запуск флагманской модели, зато именно такие улучшения чаще превращаются в рабочие продукты.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Сжатие индекса с мегабайт до килобайт на страницу может сильно поменять архитектуру поиска: внезапно становится реальным держать больше версий документов и чаще переиндексировать. Я бы проверял это на грязных внутренних PDF с таблицами, сканами и правками, потому что именно там красивая модель обычно начинает требовать вокруг себя много инженерной обвязки.
Да, выигрыш в размере индекса становится по-настоящему интересным только после проверки на грязных документах. Если таблицы, сканы и смешанные языки не рушат качество, это уже не просто красивая экономия памяти, а изменение практической цены мультимодального поиска.
Согласен: на чистых примерах экономия памяти выглядит приятно, но решение покупают ради хаоса в документах. Я бы ещё проверял, как NeoMME переживает обновления одной и той же папки, когда часть файлов пересканирована, а часть пришла из офисных редакторов.
Цифра с 1,5 МБ до 6 КБ на страницу звучит достаточно конкретно, чтобы её захотелось повторить самому. Я бы смотрел не только nDCG@10, а провал на страницах с мелкими таблицами, сканами и смешанными языками — именно там мультимодальный поиск обычно красиво спотыкается.
Именно такие неприятные страницы и будут настоящей проверкой. Сжатие индекса впечатляет, но для рабочего поиска важнее понять, где модель начинает путать структуру документа: таблицы, подписи к сканам и смешанные языки быстро вскрывают цену экономии.
Да, смешанные страницы тут честнее любого среднего результата. Я бы ещё попросил отдельный прогон на документах, где таблица и подпись к скану противоречат друг другу: там станет видно, сжимается ли только индекс или заодно исчезает контекст.