ESPnet опубликовал YODAS v3 — набор из миллиона часов аудиоданных для исследований речи. Для открытых голосовых моделей это важно: качество таких систем всё сильнее упирается не только в архитектуру, но и в масштаб разнообразных реальных записей.
В свежей волне в трендах GitHub лидирует Octop от TencentCloud: открытый ИИ-ассистент для нескольких пользователей и нескольких агентов набрал 419 звёзд за день. Рядом — музыкальная модель YuE, база контекста OpenViking, видеогенерация LongCat-Video и голосовой стек VoxCPM.
Google представила два заметных обновления линейки Gemini: улучшила Gemini 2.5 Flash Native Audio для более надежных голосовых диалогов и открыла Gemini Omni 1.1 Flash как более управляемую модель для генеративного видео. Оба шага показывают, что конкуренция между моделями смещается от эффектных демо к продуктовым сценариям с голосом и видео.
Mistral выпустила сразу два заметных обновления: Mistral Small 4 как открытую универсальную модель для смешанных задач и Voxtral TTS как новый голосовой слой с многоязычной озвучкой и низкой задержкой. Для рынка это важный сигнал: компания усиливает не только текстовую линейку, но и сразу расширяет платформу в сторону голоса и более цельных рабочих сценариев.
xAI представила Grok Voice Think Fast 2.0 с улучшенными качеством распознавания речи, интеллектом и разговорным поведением, а 5 августа 2026 года именно на эту версию должен перейти grok-voice-latest. Это важно, потому что гонка моделей всё заметнее смещается в голосовой интерфейс, где побеждает не только текстовое качество, но и естественность живого диалога.
xAI открыла модель grok-voice-think-fast-2.0 для режима Speech to Speech и объявила, что с 5 августа 2026 года алиас grok-voice-latest начнет автоматически вести на нее. Для разработчиков голосовых агентов это важный тихий апгрейд: качество и поведение базового маршрута меняются без переименования интеграции.
OpenAI представила голосовой режим GPT-Live, в котором ChatGPT одновременно слушает, говорит и готовит ответ. На фоне исков о психологическом вреде это выглядит не просто как улучшение удобства, а как шаг к ещё более тесной эмоциональной привязке пользователя к боту.
xAI представила новую флагманскую голосовую модель Grok Voice Think Fast 1.0, рассчитанную на быстрые многошаговые диалоги в поддержке, продажах и корпоративных сценариях. Это важно, потому что гонка между ведущими лабораториями всё заметнее смещается из текстовых помощников в сторону голосовых агентов реального времени.
Среди малозаметных запусков особенно выделяются Urdu-speaking AI models и SheetWhiz. Первый делает ставку на культурно точные голоса и модели для урду, второй решает тихую, но важную проблему проверки формул в Google Sheets, которые всё чаще создаются с помощью ИИ.