Инженер машинного обучения по преобразованию голоса — Cantina

Cantina нанимает senior-специалиста, который будет отвечать за прикладную сторону голосовых моделей: от архитектуры и дообучения до вывода в продовую среду. По описанию это роль для человека, который умеет не только обучать крупные речевые модели, но и выстраивать весь цикл вокруг них: подготовку данных, оценку качества, ускорение работы и защитные ограничения, связанные с согласием пользователей и безопасным применением технологии.

В объявлении указаны удалённый формат для кандидатов из США или Европы и зарплатная вилка 200–220 тысяч долларов в год. Среди задач — предварительное обучение и дообучение моделей, построение пайплайнов для обучения, проверки и промышленного использования, работа с синтетическими данными, а также измерение качества через прослушивания и метрики речи. По стеку ищут опыт с PyTorch, CUDA, DeepSpeed, распределённым обучением, диффузионными моделями, аудиокодеками, системами синтеза речи и распознавания речи, плюс умение снижать задержки.

Сама компания развивает социальную AI-платформу с AI-персонажами и инструментами для создания видео и контента, так что вакансия выглядит как реальная возможность влиять и на качество продукта, и на его ограничения по безопасности. Из плюсов перечислены доля в компании, программа 401(k), медицинская страховка, отпуск по уходу за ребёнком, оплачиваемый отпуск и отдельный бюджет на личные расходы. Это хорошая роль для инженера, который хочет работать именно на стыке речевых моделей, инфраструктуры обучения и продуктовых ограничений, а не только писать исследовательские прототипы.

Откликнуться: ссылка на вакансию