Аналитик-разработчик в команду LLM-судей для Alice AI

Яндекс · Москва · по договорённости

Компания
Яндекс
Город
Москва
Зарплата
по договорённости
Уровень
middle
Формат
удалённо
Удалённо
да

Наша команда развивает систему оценки Alice AI LLM — технологии, которая лежит в основе Алисы и других продуктов Яндекса. Нам важно понимать не только фактическую корректность ответов модели, но и то, насколько они полезны, естественны, уместно проявляют инициативу и учитывают контекст пользователя. Для оценки таких свойств мы создаём LLM-судей — модели, которые воспроизводят человеческие критерии качества.

Наши LLM-судьи уже используются для сбора обучающих данных и валидационных сравнений моделей. Сейчас мы строим единую систему их разработки и поддержки: следим за качеством существующих метрик, улучшаем их и добавляем новые аспекты оценки.

Почему у нас классно:
• LLM-as-a-Judge — быстро развивающаяся область, в которой пока нет общепринятых решений и много пространства для собственных идей
• Можно работать с самыми современными внутренними и внешними LLM, экспериментировать с разными схемами и ансамблями моделей
• Вам предстоит читать свежие исследования, воспроизводить интересные подходы и проверять их на реальных задачах
• Результаты работы напрямую влияют на развитие Alice AI: по нашим метрикам принимают эксперименты, а размеченные LLM-судьями данные используются для обучения моделей
• Здесь сочетаются исследования, анализ данных и разработка инструментов для регулярного использования
• Мы работаем не только с текстом: LLM-судьи также учитывают изображения и знания о пользователе

Что предстоит делать:
Создание и развитие LLM-судей

Вам предстоит проектировать схемы LLM-судей, экспериментировать с моделями и архитектурами, сравнивать подходы и проверять, насколько хорошо они воспроизводят человеческие критерии оценки.

Оценка и мониторинг качества

Вы будете проводить регулярные замеры на новых моделях и типах запросов, находить слабые места и систематические смещения, разбирать регрессии и проверять качество новых версий.

Развитие системы оценки

Вы начнёте добавлять новые аспекты и возможности оценки, превращать экспериментальные решения в воспроизводимые вычислительные графы для других команд.

Работа с исследованиями

Ждём, что вы будете следить за свежими статьями, разбираться в новых подходах к LLM-оценке и проверять их пользу на реальных задачах.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

Требования:
• Уверенно владеете Python и SQL
• Умеете анализировать данные и строить воспроизводимые процессы их обработки
• Знаете теорию вероятностей и математическую статистику
• Умеете проектировать метрики и интерпретировать результаты экспериментов
• Понимаете, как устроены современные LLM, и уже экспериментировали с ними
• Готовы разбираться в задачах, для которых нет готового решения
• Самостоятельны и аккуратны в выводах

Будет плюсом:
• Разрабатывали LLM-судей или другие системы автоматической оценки моделей
• Работали с метриками в NLP
• Проектировали многошаговые LLM-пайплайны
• Работали с агентными или мультимодальными системами
• Свободно читаете технические статьи на английском

Открыть и откликнуться →

Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.