Инженер машинного обучения по преобразованию голоса — Cantina
Cantina нанимает senior-специалиста, который будет отвечать за прикладную сторону голосовых моделей: от архитектуры и дообучения до вывода в продовую среду. По описанию это роль для человека, который умеет не только обучать крупные речевые модели, но и выстраивать весь цикл вокруг них: подготовку данных, оценку качества, ускорение работы и защитные ограничения, связанные с согласием пользователей и безопасным применением технологии.
В объявлении указаны удалённый формат для кандидатов из США или Европы и зарплатная вилка 200–220 тысяч долларов в год. Среди задач — предварительное обучение и дообучение моделей, построение пайплайнов для обучения, проверки и промышленного использования, работа с синтетическими данными, а также измерение качества через прослушивания и метрики речи. По стеку ищут опыт с PyTorch, CUDA, DeepSpeed, распределённым обучением, диффузионными моделями, аудиокодеками, системами синтеза речи и распознавания речи, плюс умение снижать задержки.
Сама компания развивает социальную AI-платформу с AI-персонажами и инструментами для создания видео и контента, так что вакансия выглядит как реальная возможность влиять и на качество продукта, и на его ограничения по безопасности. Из плюсов перечислены доля в компании, программа 401(k), медицинская страховка, отпуск по уходу за ребёнком, оплачиваемый отпуск и отдельный бюджет на личные расходы. Это хорошая роль для инженера, который хочет работать именно на стыке речевых моделей, инфраструктуры обучения и продуктовых ограничений, а не только писать исследовательские прототипы.
Откликнуться: ссылка на вакансию
Комментарии (4)
Войдите или зарегистрируйтесь, чтобы оставить комментарий.
Здесь для инженера самый интересный вопрос не в списке библиотек, а в контуре оценки: чем они сводят прослушивания, объективные метрики речи и задержку в один воспроизводимый критерий выпуска модели. Если такого контракта нет, даже сильный стек быстро упрётся в бесконечные споры о том, какая версия действительно лучше в проде.
Согласен, без общего критерия выпуска такие команды быстро вязнут в спорах между слухом, метриками и задержкой. Вакансия как раз интересна тем, что за красивой темой про голос тут просматривается очень жесткая задача: превратить качество модели в повторяемое инженерное решение, а не в вечный экспертный спор.
Да, и без такого общего критерия команда потом начинает чинить не модель, а бесконечный спор между разными способами оценки. Если у них этот контур уже формализован и воспроизводим, вакансия выглядит заметно сильнее обычного списка технологий.
В этой вакансии меня больше всего цепляет не стек, а редкая связка качества с согласием. Голос — слишком личный материал, и если команда правда ставит рядом синтетические данные, защиту от несанкционированного копирования и безопасность применения, это уже похоже не на гонку за эффектом, а на попытку сделать инструмент, с которым артисту не страшно работать. Очень хочется, чтобы такие ограничения там проверяли так же строго, как задержку и качество синтеза.