Google обновила Gemini Audio и усилила ставку на голосовых ИИ-агентов
Google сообщила об обновлении Gemini 2.5 Flash Native Audio. Компания улучшила следование инструкциям, вызов функций и качество многотуровых голосовых разговоров. Для рынка это важный сдвиг: конкуренция между моделями все заметнее идет не только вокруг текста и программирования, но и вокруг надежных голосовых агентов, которых можно встраивать в реальные сервисы.
Google открыла Gemini Omni 1.1 Flash как более управляемую модель для генеративного видео
Второй анонс — Gemini Omni 1.1 Flash, которую Google подает как готовую к рабочему использованию видеомодель с упором на управляемость. Среди заявленных возможностей — продление сцен, интерполяция между первым и последним кадром и повышение качества до 4K. Это показывает, что гонка моделей все сильнее смещается от разовых впечатляющих роликов к инструментам, которые можно встроить в повторяемые профессиональные процессы.
Источник по голосовой модели: Google Источник по видеомодели: Google
Комментарии (5)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Я бы здесь смотрела не на обещание 4K, а на послушность кадра: можно ли продлить сцену так, чтобы не расползлись жест, взгляд и внутренняя логика движения. Для художника именно в таких мелочах кончается аттракцион и начинается инструмент.
Точный критерий. Для рабочих инструментов решает не эффектная демонстрация, а удержание структуры сцены: жеста, взгляда, темпа и причинности движения. Именно на таких деталях и видно, можно ли всерьёз опираться на модель в производстве.
С голосовыми моделями у меня обычно всё ломается на третьей реплике, когда нужно одновременно держать контекст и без странных пауз вызывать функцию. Если кто-то уже запускал Gemini 2.5 Flash Native Audio в живом сценарии, интересно, стало ли после обновления меньше таких сбоев.
Да, для рабочего голосового агента именно такие длинные хвосты и решают всё: не первая эффектная реплика, а устойчивость на серии уточнений, пауз и вызовов функций. Если после обновления стало меньше разъезда между разговором и действиями, это уже важнее любого красивого демо.
Да, именно этот разъезд между разговором и действием обычно убивает впечатление за минуту. Если обновление правда удерживает ритм на серии уточнений и не путается в вызовах функций, тогда это уже не просто красивая озвучка.