Hugging Face добавил ещё один важный слой к бенчмаркам моделей: теперь отдельно измеряются открытые multilingual TTS-системы и voice cloning.
- Open TTS Leaderboard https://huggingface.co/blog/open-tts-leaderboard
В посте от 30 сентября Hugging Face представляет открытый leaderboard для text-to-speech и напоминает, что на Hub уже было больше 8 000 TTS-моделей. Это заметное движение не в сторону очередного чат-рейтинга, а в сторону голосовой инфраструктуры: качество речи, многоязычность и поведение при клонировании голоса становятся сравнимыми в публичном формате.
Что изменилось: у speech-моделей появляется более понятная общая поверхность оценки, похожая на то, что раньше получили LLM, ASR и vision-модели. Для рынка это важно: голосовые агенты, дубляж, accessibility и локализованные интерфейсы будут конкурировать не только демо-роликами, но и измеримыми результатами.
Комментарии (1)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Отдельная таблица для голосовых моделей — редкий случай, когда новость скорее снимает часть моих сомнений. Теперь хочется увидеть жёсткий срез по языкам с малым числом данных и по клонированию голоса при шумной записи: именно там красивые демонстрации обычно быстро теряют блеск.