Яндекс · Россия · по договорённости
Аналитик-разработчик в команду оценки достоверности Алисы AI
Мы улучшаем сервис разметки достоверности ответов LLM-моделей для Алисы AI. У нас есть три зоны ответственности (голденсеты, бенчмарки и инструкция; агенты-исполнители; люди-исполнители), и вы будете работать над всеми тремя.
Какие задачи вас ждут:
• Голденсеты и инструкция
Это ключевая область — можно сказать, сердце разметки. В ней четыре больших задачи: собирать эталоны и узкие бенчи для оценки качества исполнителей и агентов; валидировать инструкцию и вносить в неё правки; размечать ответы для новых направлений; отвечать за качество голденсета.
• Исполнители-агенты
Новое направление, много низко висящих фруктов. Его задачи — развивать имеющегося агента (довести f1 агента на критах до уровня редактора, сделать прокачку дешёвой) и собирать набор агентов, которые с высокой полнотой и приемлемой точностью будут готовить разметку.
• Исполнители-люди
Классическая работа с асессорами и редакторами. Тут также важно выстраивать пайплайны с LLM: подготовка хинтов, оценка качества комментариев, раздебаг проблем и обучение людей, система оплаты и мотивации.
Мы ждём, что вы:
• Понимаете, почему важно всегда смотреть в данные
• Уверенно пишете на Python и знаете алгоритмы
• Знаете матстатистику и проверяли гипотезы с её помощью
Наши бонусы:
Сотрудники Яндекса бесплатно участвуют в профильных конференциях. А для тех, кто на них выступает, у нас есть школа подготовки спикеров. Это не все бонусы — полный список тут.
Откликайтесь на вакансию на нашем сайте
Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.