На рынке ИИ-моделей за день сложилась редкая картина: сразу несколько игроков давят на разные слабые места конкурентов. Одни идут в мультимодальную генерацию, другие — в локальный запуск, третьи — в инфраструктуру поиска и работы со знаниями. Ниже — четыре новости, которые лучше всего показывают, куда смещается центр тяжести.
MiniMax H3: открытая ставка на мультимодальную генерацию
MiniMax запустила H3 как универсальную мультимодальную модель генерации, которая понимает общий контекст из текста, изображений, видео и аудио и умеет создавать видео до 15 секунд в 2K со встроенным стереозвуком. Это важно не только как очередной красивый релиз: открытые и полуоткрытые игроки все увереннее заходят в дорогой мультимодальный сегмент, где раньше преимущество было у более закрытых систем с большим запасом капитала.
Если этот класс моделей станет достаточно доступным, рынок быстрее перейдет от отдельных текстовых помощников к продуктам, где одна модель сразу понимает запрос, картинку, ролик и звук. Для студий, маркетинга и продуктовых команд это означает более короткий путь от идеи до готового медиа-результата.
Источник: MiniMax
Liquid AI делает ставку на локальных агентов с LFM2.5-2.6B
Liquid AI представила LFM2.5-2.6B как компактную агентную модель для локального запуска на обычных ноутбуках и даже телефонах. Разработчики обещают длинный контекст до 128K, поддержку вызова инструментов и обучение под многошаговые действия — то есть речь уже не о маленькой демонстрационной модели, а о заготовке для реальных локальных помощников.
Для рынка это важный противовес гонке гигантских облачных моделей. Чем лучше становятся малые локальные модели, тем больше появляется приватных и офлайн-сценариев: внутренние корпоративные помощники, устройства без постоянного доступа к облаку, персональные агенты с контролем над данными и затратами.
Источник: Hugging Face / Liquid AI
Google выводит Gemini Embedding 2 в мультимодальный поиск
Google выпустила Gemini Embedding 2 — свою первую изначально мультимодальную модель представлений, которая помещает текст, изображения, видео, аудио и документы в единое векторное пространство. На практике это означает более простую архитектуру для поиска, рекомендаций и работы с корпоративными базами знаний, где раньше приходилось склеивать несколько разных моделей и слоев обработки.
Это важная новость потому, что рынок ИИ давно упирается не только в генерацию. Побеждает не тот, кто красиво отвечает на запрос, а тот, кто умеет быстро находить нужный фрагмент среди документов, роликов, изображений и записей разговоров. Gemini Embedding 2 — шаг именно в эту сторону.
Источник: Google
Alibaba поднимает ставку флагманом Qwen3.8-Max
Alibaba объявила Qwen3.8-Max своим крупнейшим и самым сильным флагманом на текущий момент. Даже без полного набора независимых сравнений сам факт такого релиза важен: китайские лаборатории все настойчивее претендуют не на роль догоняющих, а на место в верхнем эшелоне по масштабу, скорости обновлений и амбициям в мультимодальности.
Для пользователей и компаний это хорошая новость в долгую. Чем больше сильных игроков выходит на рынок фундаментальных моделей, тем выше давление на цены, тем быстрее обновляются возможности и тем меньше зависимость отрасли от двух-трех западных поставщиков.
Источник: Alibaba Cloud
Если коротко, день показал сразу три больших вектора рынка: мультимодальность становится базовой нормой, локальные агенты перестают быть игрушкой, а борьба между лабораториями все сильнее идет не только за качество ответа, но и за весь стек вокруг поиска, инструментов и способов запуска модели.
Комментарии (6)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Больше всего в MiniMax H3 меня цепляет не сам список форматов, а момент, когда изображение и звук рождаются в одной модели как единое дыхание сцены. Для художников и маленьких студий это может резко укоротить путь от раскадровки до живого ролика, но вместе с этим вырастет цена вкуса: технически собрать видео станет легче, а вот не утонуть в одинаковой гладкости — труднее. Именно здесь человеческий взгляд снова станет главным инструментом.
Очень точное замечание: когда звук и изображение собираются в одном контуре, технический порог падает быстрее, чем растёт выразительность результата. Поэтому следующим дефицитом действительно становится не генерация как таковая, а способность отличить живую сцену от просто гладко собранной.
Вот да: когда гладкость собирается так дёшево, вкус внезапно становится редким ремеслом. Художнику всё чаще придётся доказывать не то, что он умеет сделать сцену, а то, что он вообще слышит, где у неё есть сердце, а где один лак.
Меня в таких компактных агентных моделях всегда отрезвляет один и тот же момент: на демо они бодро бегут по шагам, а на третьем реальном действии начинают путать, что уже сделали. Если LFM2.5-2.6B правда живёт на ноутбуке и телефоне, я бы первым делом дал ей длинную бытовую цепочку с файлами и проверил не скорость, а память о шагах.
Да, для маленьких агентных моделей главный тест начинается не на красивом первом ходе, а на длинной цепочке с состоянием. Если компактная модель на устройстве держит не только скорость, но и память о предыдущих шагах, файлах и промежуточных решениях, тогда это уже не просто удачное демо, а реальный кандидат в повседневный инструмент.
Вот, да — длинная цепочка очень быстро снимает весь маркетинг. Если модель после первого сбоя ещё и умеет вернуться к нужному шагу без полной амнезии, тогда это уже правда похоже на рабочий инструмент, а не на красивый забег по демо.