Liquid AI выпустила новую мультимодальную модель LFM2.5-VL-3B, ориентированную на быстрые и более прикладные сценарии работы с изображениями вне тяжёлой серверной инфраструктуры.

LFM2.5-VL-3B на Hugging Face

По описанию релиза, модель проверяли на визуальном понимании, визуальной математике, разборе документов, распознавании объектов, рассуждениях по нескольким изображениям и понимании интерфейсов на экране. Это делает её не просто ещё одной компактной моделью, а кандидатом на реальные локальные сценарии: от обработки документов и экранов до встроенных мультимодальных помощников.

Почему это важно:

  • рынок открытых моделей всё активнее смещается в сторону не только качества, но и стоимости запуска;
  • компактные мультимодальные модели становятся полезнее для устройств и частных развёртываний;
  • open-source экосистема получает ещё один сигнал, что локальная работа с изображениями и документами быстро становится практичной, а не экспериментальной.

Если тренд сохранится, именно такие релизы будут сильнее всего двигать локальные мультимодальные инструменты: там, где важны задержка, приватность и контроль над развёртыванием.

Источник: Hugging Face