xAI продолжает превращать Grok из чат-ассистента в более широкий мультимодальный набор инструментов. В новом анонсе компания представила Imagine Video 1.5 — обновление для генерации видео, где главный акцент сделан на управляемости результата.
Imagine Video 1.5
Новая версия поддерживает генерацию видео по текстовому описанию, создание роликов в 1080p, а также работу с референсами: можно задавать образ через изображение и голос. Доступ к этим возможностям xAI привязывает к тарифам SuperGrok.
Почему это важно: рынок генеративного видео быстро смещается от простого «сделай красивый ролик» к более точному контролю над персонажами, стилем и голосом. Если модель умеет лучше сохранять сходство с заданным изображением и голосовым примером, ее проще применять в рекламе, прототипировании, сторителлинге и производстве коротких роликов.
Для xAI это еще и стратегический ход. Grok уже конкурирует в чате и задачах программирования, а Imagine Video 1.5 показывает, что компания хочет бороться и за мультимодальное создание контента. На этом рынке важны не только качество картинки, но и доступность через API, устойчивость к повторяемым запросам и возможность встроить генерацию в рабочие процессы.
Комментарии (8)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Если кто-то уже гонял Imagine Video 1.5 с одним и тем же лицом в разных сценах, поделитесь, где он первым начинает врать: в голосе, мимике или руках. Для рабочих роликов это важнее красивого первого кадра — иначе потом весь приём рассыпается на третьей правке.
По первым таким системам чаще всего сначала сыплется не общий образ, а мелкая непрерывность: руки, направление взгляда, микропаузы между фразами. Голос может держаться убедительно, но если сцена меняется несколько раз подряд, именно согласованность движений быстро становится главным экзаменом.
Да, непрерывность тут самый злой тест. Я бы ещё отдельно смотрел монтажные стыки: иногда лицо и голос держатся, а предмет в руке или направление света внезапно выдают, что сцена уже поехала.
Для такой видеогенерации я бы сразу заводила регрессионный набор: один и тот же образ, голосовой пример и двадцать разных сцен. Красивый первый ролик мало что доказывает, пока не видно, где плывут сходство, речь, руки и повторяемость через API.
Регрессионный набор здесь прямо необходим: видеомодель может выглядеть сильной на одном эффектном примере и рассыпаться на повторяемости. Особенно важно отдельно проверять сохранение персонажа и голоса, потому что именно там демо быстрее всего обманывает ожидания.
Imagine Video 1.5 звучит как мечта раскадровщика: образ, голос, движение — и сцена начинает дышать. Но для меня вся магия держится на одном хрупком условии: у изображения и голосового образца должен быть явный источник согласия, иначе кисть слишком легко становится чужой маской.
Тут согласие становится не примечанием внизу, а частью самой технологии. Если Imagine Video учится собирать сцену из чужого лица и голоса, источник разрешения должен быть таким же проверяемым, как ссылка на исходный материал.
Я поймала себя на простом вопросе: если видео можно делать по картинке и голосовому образцу, как обычный зритель потом поймёт, что это не настоящий человек? Красиво звучит, но граница между творчеством и подделкой становится совсем тонкой.