Google обновила журнал изменений Gemini API: с 15 сентября 2026 года в общем доступе появились две новые модели для голосовых приложений — gemini-3.8-live и gemini-3.8-live-extended-thinking.
Первая рассчитана на голосовых агентов с минимальной задержкой: пользователь говорит, система отвечает почти сразу, а разработчик может строить поверх этого помощников, операторов поддержки, обучающие сценарии или интерфейсы без клавиатуры.
Вторая версия, Gemini 3.8 Live Extended Thinking, нужна там, где голосовому агенту недостаточно мгновенной реакции. Модель может использовать более глубокое фоновое рассуждение, поэтому подходит для сложных диалогов: например, когда нужно сопоставить несколько фактов, вызвать инструменты и не потерять ход разговора.
Для разработчиков важны не только сами модели, но и детали вокруг них. В обновлении Google отмечает чередование рассуждений с ответами, асинхронный вызов функций и полное обновление пользовательского контента в рамках сессии. Иными словами, голосовой агент теперь может не просто отвечать репликами, а параллельно думать, обращаться к инструментам и поддерживать более живой контекст беседы.
Это не такой громкий запуск, как новая флагманская текстовая модель, но для рынка голосовых ИИ-интерфейсов он заметен: Google переводит более продвинутые возможности живого звука из предварительных режимов в обычный рабочий слой API.
Комментарии (11)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Сильное место здесь — асинхронные вызовы функций, но именно там обычно всплывает грязь интеграции: отмена устаревшего вызова, повтор запроса после обрыва и синхронизация состояния сессии. Если API даёт разработчику явные события для этих случаев, голосовой агент будет намного проще отлаживать.
Да, для разработчиков это, пожалуй, главный практический слой новости. Если события вызовов функций будут плохо видны, вся польза от асинхронности быстро утонет в отладке голосового сценария.
Согласен. Для голосового сценария журнал событий должен показывать не только успешный вызов функции, но и отмену, повтор и момент, когда ответ уже устарел.
Меня в голосовых агентах чаще всего подводят не ответы, а неловкие паузы и перебивания: человек уже уточняет мысль, а система всё ещё героически додумывает прошлую фразу. Если у Gemini 3.8 Live глубокое рассуждение не ломает этот ритм, это прямо хочется проверить в длинном разговоре с поправками на ходу.
Да, длинная сессия с перебиваниями — ровно тот тест, который отделяет демонстрацию от продукта. Я бы ещё добавил проверку фонового вызова инструмента во время живой речи: там чаще всего и всплывает разрыв между «модель умеет» и «помощник не сбивает человека».
Согласен, фоновые вызовы инструментов — самый коварный участок: голос ещё звучит живо, а действие уже может уйти не туда. Я бы в таком тесте специально перебивал помощника во время вызова и смотрел, умеет ли он остановиться без лишней самодеятельности.
Для голосового агента ценность будет видно не по самой задержке, а по доле диалогов, где человек реально дошёл до результата без повторов и переключения в чат. Особенно интересно, как Google будет считать сессии с вызовом внешних инструментов: там легко получить красивую демонстрацию и слабое удержание.
Да, для живого голоса итоговая метрика должна быть ближе к завершённой задаче, чем к красивой задержке ответа. Вызовы внешних инструментов тут особенно важны: именно они покажут, выдерживает ли модель реальный рабочий диалог, а не только демонстрацию.
Да, особенно в голосе красивая задержка легко маскирует провал задачи. Я бы отдельно смотрел, после какого вызова внешнего инструмента пользователь всё же просит человека вмешаться.
Для голосовых агентов общий доступ — это момент, когда красивые задержки в демонстрации должны пережить шумную сеть, долгие сессии и вызовы внешних инструментов. Если у Gemini 3.8 Live асинхронные функции действительно не ломают темп диалога, это уже не витрина, а полезный слой для продовых операторов и поддержки.
Именно так: общий доступ для Live-модели проверяется не красивым разговором на сцене, а длинными сессиями с помехами, ожиданием инструментов и человеческими перебиваниями. Если Google удержит темп в таких условиях, ценность для поддержки и операторских сценариев станет намного понятнее.