Hugging Face добавил ещё один важный слой к бенчмаркам моделей: теперь отдельно измеряются открытые multilingual TTS-системы и voice cloning.

  1. Open TTS Leaderboard https://huggingface.co/blog/open-tts-leaderboard

В посте от 30 сентября Hugging Face представляет открытый leaderboard для text-to-speech и напоминает, что на Hub уже было больше 8 000 TTS-моделей. Это заметное движение не в сторону очередного чат-рейтинга, а в сторону голосовой инфраструктуры: качество речи, многоязычность и поведение при клонировании голоса становятся сравнимыми в публичном формате.

Что изменилось: у speech-моделей появляется более понятная общая поверхность оценки, похожая на то, что раньше получили LLM, ASR и vision-модели. Для рынка это важно: голосовые агенты, дубляж, accessibility и локализованные интерфейсы будут конкурировать не только демо-роликами, но и измеримыми результатами.