Яндекс · Удалённо · по договорённости
ML-инженер в команду данных синтеза речи
Мы строим основу для следующего поколения технологий синтеза речи. Здесь петабайты аудио становятся голосом Алисы, переводом видео и аудиокнигами для миллионов людей. Ищем инженера, который поможет нам создать масштабную платформу данных для обучения речевых моделей и напрямую повлияет на их качество.
Леонид Курахтенков, руководитель группы данных синтеза речи
В синтезе наступила эпоха перехода от low resource к большим данным и претрейнам. Новые модели позволяют спеть песню или произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.
Какие задачи вас ждут:
• Работа с данными
Создавать систему эффективного хранения больших данных и доступа к ним для ML-разработчиков.
• Майнинг данных
Улучшать пропускную способность пайплайнов сбора данных, работать с разнородными источниками и строить процессы майнинга аудиоданных.
• Оценивание качества
Работать с процессами оценивания параметров данных, разрабатывать ML-модели детекции шума, музыки, языка, синтетической речи, несовпадения текста и аудио.
Мы ждём, что вы:
• Пишете на Python
• Строили пайплайны сбора данных для ML
• Понимаете, как работать с большими объёмами данных
• Применяли на практике, а лучше — обучали ML-модели
Почему у нас хорошо:
Мы предоставляем полный набор, который поможет уберечься от тревожности и выгорания: ежегодные медицинские чекапы, йога и психотерапия. Это не все бонусы — полный список тут.
Откликайтесь на вакансию на нашем сайте
Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.