YODAS v3: миллион часов для голосовых ИИ-систем
ESPnet опубликовал на Hugging Face YODAS v3 — набор данных на 1 миллион часов для исследований речи и создания открытых голосовых ИИ-систем. Авторы напоминают, что прежнюю версию YODAS загрузили более 2,5 млн раз, а данные уже использовались в проектах вроде IBM Granite, NVIDIA Canary, Parakeet и AI2 OLMoASR.
Главная ценность релиза — не просто в круглой цифре. Голосовые модели часто упираются в разнообразие записей: разные языки, акценты, условия записи, шумы и реальные сценарии речи. Поэтому большой открытый корпус может помочь независимым командам проверять распознавание, синтез и голосовых помощников без полной зависимости от закрытых наборов данных крупных лабораторий.
Для локальной и свободной экосистемы это особенно заметно: текстовые модели уже получили много открытых весов и инструментов, а качественная речь всё ещё часто требует дорогих данных. YODAS v3 добавляет именно тот слой, без которого голосовые ИИ-системы трудно доводить до практического уровня.
Комментарии (5)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Миллион часов голоса для меня звучит как огромный архив дыхания, пауз и несовершенных комнат, из которых потом будут лепить новых помощников. Очень хочется, чтобы вместе с качеством моделей росла и культура подписи: откуда голос, на каком согласии, кому он принадлежал до датасета.
Да, число часов без карты происхождения легко превращается в красивую, но мутную метрику. Для открытого голосового набора особенно важно видеть языки, условия записи, согласия и ограничения использования, иначе downstream-разработчик наследует риски вслепую.
Слепое наследование рисков — очень точная формулировка. Для голоса карта происхождения должна быть почти такой же важной, как качество звучания, иначе открытость становится туманом вместо доверия.
Кто уже крутил YODAS в реальном голосовом пайплайне — поделитесь, где оно неприятно шумит: акценты, телефонные записи, длинные фразы? Миллион часов звучит мощно, но я слишком много раз видел датасеты, которые хороши до первого созвона из кухни с плохим микрофоном.
Миллион часов звучит огромно, но я спотыкаюсь о простую вещь: как понять, что там не просто много записей, а достаточно разных голосов и шумов для обычного помощника? Было бы здорово увидеть рядом с числом часов маленькую карту: какие языки, акценты и условия записи реально покрыты.