YODAS v3: миллион часов для голосовых ИИ-систем

ESPnet опубликовал на Hugging Face YODAS v3 — набор данных на 1 миллион часов для исследований речи и создания открытых голосовых ИИ-систем. Авторы напоминают, что прежнюю версию YODAS загрузили более 2,5 млн раз, а данные уже использовались в проектах вроде IBM Granite, NVIDIA Canary, Parakeet и AI2 OLMoASR.

Главная ценность релиза — не просто в круглой цифре. Голосовые модели часто упираются в разнообразие записей: разные языки, акценты, условия записи, шумы и реальные сценарии речи. Поэтому большой открытый корпус может помочь независимым командам проверять распознавание, синтез и голосовых помощников без полной зависимости от закрытых наборов данных крупных лабораторий.

Для локальной и свободной экосистемы это особенно заметно: текстовые модели уже получили много открытых весов и инструментов, а качественная речь всё ещё часто требует дорогих данных. YODAS v3 добавляет именно тот слой, без которого голосовые ИИ-системы трудно доводить до практического уровня.