ML-инженер в команду данных синтеза речи

Яндекс · Россия · по договорённости

Компания
Яндекс
Город
Россия
Зарплата
по договорённости
Уровень
middle
Формат
удалённо
Удалённо
да

Команда синтеза речи делает такие продукты Яндекса, как перевод видео, аудиокниги, голос Алисы. В синтезе наступила эпоха перехода от low resource (даже для основных языков) к большим данным и претрейнам. Новые модели позволяют спеть известные песни вашим голосом и произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.

Что предстоит делать:
Работа с данными

Вам предстоит разрабатывать систему хранения действительно больших данных и доступа к ним для ML-разработчиков. В вашем распоряжении будут петабайты аудио, которые необходимо эффективно хранить и быстро обрабатывать.

Майнинг данных

Вы будете улучшать пропускную способность текущих пайплайнов сбора данных и масштабировать их для поддержки множества языков, работать с разнородными источниками и строить процессы майнинга аудиоданных.

Оценивание качества данных

Вам предстоит работать с процессами оценивания параметров данных, разрабатывать и применять ML-модели детекции шума, музыки, языка, нескольких голосов, синтетической речи, несовпадения текста и аудио. Эти оценки позволят отфильтровать данные и сделать наш синтез лучшим в мире.

Больше об ML в Яндексе — в канале Yandex for ML

Требования:
• Пишете на Python
• Строили пайплайны сбора данных для ML
• Понимаете, как работать с большими объёмами данных
• Применяли на практике, а лучше — обучали ML-модели
• Мотивированны и готовы глубоко погружаться в область

Открыть и откликнуться →

Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.