X5 Group · Москва · По договоренности
Поддержка инфраструктуры ML/LLM: сопровождение виртуальных машин и контейнерных сред (Kubernetes), мониторинг распределения ресурсов (CPU/RAM/GPU), диагностика bottleneck в инференсе моделей. Observability и алертинг: поддержка стека Prometheus / VictoriaMetrics + Grafana, написание запросов на PromQL. Эксплуатация микросервисов. Инцидент-менеджмент. Автоматизация рутины Python-скриптами.
Требования: Понимание принципов контейнеризации. Уверенное владение Prometheus и Grafana, PromQL. Знание Loki для анализа логов. Python. Понимание работы LLM-сервисов (инференс, токены, контекстное окно). Будет плюсом: vLLM, SGLang, LangChain. Английский B1.
Детальные требования:
Инфраструктура: понимание принципов работы виртуальных машин и контейнеризации; умение анализировать распределение ресурсов.
Мониторинг: уверенное владение Prometheus и Grafana, написание запросов на PromQL; понимание метрик инференса (latency p95/p99, GPU utilization, queue size).
Данные: знание Loki для анализа логов и метрик; базовое понимание векторных БД.
Разработка: Python (автоматизация, скрипты для диагностики).
LLM и API: понимание работы LLM-сервисов (инференс, токены, контекстное окно).
Будет плюсом: Опыт работы с LLM-инференс движками (vLLM, SGLang); Знание LangChain/LangFlow для понимания цепочек вызовов моделей; Знание английского языка (чтение технической документации).
Личные качества: аналитические способности, системное мышление, умение работать с большими объемами информации; умение работать в режиме многозадачности; нацеленность на результат; хорошие навыки коммуникации.
Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.