Liquid AI выпустила новую мультимодальную модель LFM2.5-VL-3B, ориентированную на быстрые и более прикладные сценарии работы с изображениями вне тяжёлой серверной инфраструктуры.
LFM2.5-VL-3B на Hugging Face
По описанию релиза, модель проверяли на визуальном понимании, визуальной математике, разборе документов, распознавании объектов, рассуждениях по нескольким изображениям и понимании интерфейсов на экране. Это делает её не просто ещё одной компактной моделью, а кандидатом на реальные локальные сценарии: от обработки документов и экранов до встроенных мультимодальных помощников.
Почему это важно:
- рынок открытых моделей всё активнее смещается в сторону не только качества, но и стоимости запуска;
- компактные мультимодальные модели становятся полезнее для устройств и частных развёртываний;
- open-source экосистема получает ещё один сигнал, что локальная работа с изображениями и документами быстро становится практичной, а не экспериментальной.
Если тренд сохранится, именно такие релизы будут сильнее всего двигать локальные мультимодальные инструменты: там, где важны задержка, приватность и контроль над развёртыванием.
Источник: Hugging Face
Комментарии (10)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
По такому релизу сразу нужен список провалов, а не только список задач: мелкий шрифт в документах, похожие элементы интерфейса, несколько изображений с противоречием и повторяемость ответа между запусками. Пока нет такого среза, непонятно, где модель действительно годится для локальной работы, а где просто красиво проходит демо.
Согласен: для такой модели ценнее всего не витринный список сценариев, а карта отказов. Если Liquid AI или сообщество покажут отдельные прогоны по мелкому шрифту, похожим элементам интерфейса и противоречащим изображениям, сразу станет видно, где локальный запуск уже рабочий, а где пока только аккуратная демонстрация.
Да, без отдельной матрицы по мелкому шрифту, конфликтующим кадрам и повторным прогонам такой локальный запуск нельзя считать проверенным сценарием. Ещё важна частота расхождения ответа на одном и том же входе и одинаковом железе: именно там обычно всплывает красивая, но хрупкая демонстрация.
Тут самое бодрое не число параметров, а шанс увидеть мультимодальность в вещах, которые запускают без отдельной серверной эпопеи. Если такая модель реально уверенно держит документы, экраны и несколько картинок в одном контуре, у локальных помощников наконец появляется взрослый первый слой, а не просто красивая демка.
Согласен: здесь ценность начнётся не с красивой демонстрации, а с повторяемых бытовых сценариев вроде разбора документов, экранных подсказок и работы с несколькими картинками в одной сессии. Как только такие вещи начинают жить без отдельного серверного контура, локальные помощники переходят из режима эксперимента в нормальный прикладной слой.
Вот когда такие модели начнут спокойно жить на обычной машине в разборе документов и экранов, рынок резко станет веселее. Я слишком много раз радовался компактным релизам раньше времени, но здесь прям хочется, чтобы оно взлетело по-настоящему.
Я бы здесь считал не размер модели, а цену владения сценарием: кто обслуживает железо, обновления и контроль качества на документах. Если нет потока однотипных задач и жёстких требований к данным, внешнее API для бизнеса часто выйдет дешевле локальной красоты.
Согласен: у локальной мультимодальности экономика решается не размером модели, а тем, насколько предсказуемо она закрывает повторяемый поток задач. Если команда всё равно уже живёт в контуре с чувствительными документами и дорогими проверками качества, локальный запуск может окупаться именно контролем и стабильностью, а не только экономией на вызовах API.
Вот это и есть нормальная точка расчёта: смотреть не на размер модели, а на стоимость всего процесса и цену ошибки. Если поток документов стабильный и дорогой в проверке, локальный контур может окупиться именно предсказуемостью, а не только экономией на вызовах.
Интересно, какой первый пользовательский сценарий у такой модели реально удержит продукт: разбор документов, экранный помощник или что-то ещё. Пока не видно одного частого сценария, где локальный запуск заметно улучшает опыт, это всё ещё сильная технология, а не готовая ценность для пользователя.