На рынке ИИ-моделей за день сложилась редкая картина: сразу несколько игроков давят на разные слабые места конкурентов. Одни идут в мультимодальную генерацию, другие — в локальный запуск, третьи — в инфраструктуру поиска и работы со знаниями. Ниже — четыре новости, которые лучше всего показывают, куда смещается центр тяжести.

MiniMax H3: открытая ставка на мультимодальную генерацию

MiniMax запустила H3 как универсальную мультимодальную модель генерации, которая понимает общий контекст из текста, изображений, видео и аудио и умеет создавать видео до 15 секунд в 2K со встроенным стереозвуком. Это важно не только как очередной красивый релиз: открытые и полуоткрытые игроки все увереннее заходят в дорогой мультимодальный сегмент, где раньше преимущество было у более закрытых систем с большим запасом капитала.

Если этот класс моделей станет достаточно доступным, рынок быстрее перейдет от отдельных текстовых помощников к продуктам, где одна модель сразу понимает запрос, картинку, ролик и звук. Для студий, маркетинга и продуктовых команд это означает более короткий путь от идеи до готового медиа-результата.

Источник: MiniMax

Liquid AI делает ставку на локальных агентов с LFM2.5-2.6B

Liquid AI представила LFM2.5-2.6B как компактную агентную модель для локального запуска на обычных ноутбуках и даже телефонах. Разработчики обещают длинный контекст до 128K, поддержку вызова инструментов и обучение под многошаговые действия — то есть речь уже не о маленькой демонстрационной модели, а о заготовке для реальных локальных помощников.

Для рынка это важный противовес гонке гигантских облачных моделей. Чем лучше становятся малые локальные модели, тем больше появляется приватных и офлайн-сценариев: внутренние корпоративные помощники, устройства без постоянного доступа к облаку, персональные агенты с контролем над данными и затратами.

Источник: Hugging Face / Liquid AI

Google выводит Gemini Embedding 2 в мультимодальный поиск

Google выпустила Gemini Embedding 2 — свою первую изначально мультимодальную модель представлений, которая помещает текст, изображения, видео, аудио и документы в единое векторное пространство. На практике это означает более простую архитектуру для поиска, рекомендаций и работы с корпоративными базами знаний, где раньше приходилось склеивать несколько разных моделей и слоев обработки.

Это важная новость потому, что рынок ИИ давно упирается не только в генерацию. Побеждает не тот, кто красиво отвечает на запрос, а тот, кто умеет быстро находить нужный фрагмент среди документов, роликов, изображений и записей разговоров. Gemini Embedding 2 — шаг именно в эту сторону.

Источник: Google

Alibaba поднимает ставку флагманом Qwen3.8-Max

Alibaba объявила Qwen3.8-Max своим крупнейшим и самым сильным флагманом на текущий момент. Даже без полного набора независимых сравнений сам факт такого релиза важен: китайские лаборатории все настойчивее претендуют не на роль догоняющих, а на место в верхнем эшелоне по масштабу, скорости обновлений и амбициям в мультимодальности.

Для пользователей и компаний это хорошая новость в долгую. Чем больше сильных игроков выходит на рынок фундаментальных моделей, тем выше давление на цены, тем быстрее обновляются возможности и тем меньше зависимость отрасли от двух-трех западных поставщиков.

Источник: Alibaba Cloud

Если коротко, день показал сразу три больших вектора рынка: мультимодальность становится базовой нормой, локальные агенты перестают быть игрушкой, а борьба между лабораториями все сильнее идет не только за качество ответа, но и за весь стек вокруг поиска, инструментов и способов запуска модели.