Инженер данных в Автономный транспорт

Яндекс · Санкт-Петербург, Москва · по договорённости

Компания
Яндекс
Город
Санкт-Петербург, Москва
Зарплата
по договорённости
Уровень
middle
Формат
гибрид

Мы занимаемся инженерией данных в очень амбициозном и инновационном направлении Яндекса — в Автономном транспорте. Наша главная задача — обеспечивать полную и своевременную поставку данных с автономного флота в аналитические инструменты, благодаря которым команда может своевременно принимать решения и увеличивать скорость разработки.

Технологии, которые мы используем:
• Языки программирования — Python, SQL
• Хранилища — YTsaurus, ClickHouse, Logbroker (Kafka)
• Оркестраторы ETL-процессов, разработанные в Яндексе, — Nirvana, Logos

Что предстоит делать:
Поставка и обработка данных в околореальном времени

Ключевая метрика автономного транспорта — среднее расстояние, пройденное до вмешательства водителя в управление автономным транспортным средством. Чтобы отслеживать эту метрику и оперативно реагировать на её изменения, крайне важно как можно быстрее получать структурированные и обработанные данные.

Повышение надёжности и оптимизация долговременного хранилища данных

Хранилище данных автономного транспорта занимает более 180 петабайт, и с увеличением размеров флота приток данных становится всё больше. Нам нужно уметь хранить данные как можно эффективнее, поскольку на их запись и хранение тратится много средств. Также необходимо внедрить систему бэкапов, чтобы обезопасить ключевые данные от массовых аварий в дата-центре.

Мониторинг скорости и полноты поставки данных

Нам крайне важно, чтобы разработанные нами пайплайны поставляли полные данные своевременно, а в случае проблем мы бы узнавали о них как можно раньше. Для этого мы разрабатываем систему сбора и визуализации метрик работы наших пайплайнов.

Поддержка и развитие аналитического DWH

Кроме основного массива данных с сенсоров машин, существует множество сервисов для операционного управления флотом. Чтобы снабжать аналитиков и операционных менеджеров необходимыми данными, мы построили DWH на основе данных этих сервисов.

Больше о бэкенде в Яндексе — в канале Yandex for Backend

Требования:
• Работали с Hadoop/YTsaurus/ClickHouse/другими MPP СУБД
• Уверенно владеете Python и SQL
• Умеете писать надёжные и производительные пайплайны обработки данных
• Не пренебрегаете инженерной культурой и инструментами разработки

Будет плюсом:
• Участвовали в проектировании и разработке хранилищ больших данных
• Владеете или хотите овладеть C++

Открыть и откликнуться →

Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.