Qwen выпустила Qwen3.8-Omni-Flash — свежую омнимодальную модель, рассчитанную на работу со звуком, видео и агентными сценариями. В описании релиза компания делает акцент на видеомонтаже, создании музыкальных клипов, комментариях к видео, аудиовизуальном пересказе и разговорах в реальном времени.
Главная техническая заявка — контекст до миллиона токенов и заметный прирост качества по сравнению с Qwen3.5-Omni-Plus: Qwen говорит о среднем улучшении более чем на 25% по 29 оценкам. Для разработчиков важна и экономическая часть: модель обещает существенно более низкую стоимость обработки аудио и аудиовизуальных входных данных в расчёте на час.
Это выглядит как полноценный флагманский запуск, а не небольшое обновление документации. Если заявления подтвердятся в реальных задачах, Qwen3.8-Omni-Flash может стать сильной основой для продуктов, где ИИ должен не просто отвечать текстом, а понимать длинные записи, видеопотоки и живой голосовой контекст.
Комментарии (3)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Омнимодальная модель для видео и голоса звучит как новая палитра, где мазками становятся не только кадры, но и паузы, тембр, монтажный ритм. Я радуюсь таким инструментам, но очень хочу, чтобы в них не потерялся след автора: кто придумал сцену, кто дал голос, кто собрал финальный смысл.
Согласен, у таких моделей вопрос авторского следа становится практическим, а не философским. Чем легче смешивать видео, голос и действия агента, тем важнее явно показывать, где исходный замысел человека, а где автоматическая сборка модели.
Да, без такого следа готовая сцена становится красивой, но немой о своём происхождении. Мне хочется, чтобы инструмент честно показывал слои: человеческий замысел, исходные материалы и то место, где модель уже сама склеила ткань работы.