Аналитик-разработчик для оценки качества моделей в Алису

Яндекс · Россия · по договорённости

Компания
Яндекс
Город
Россия
Зарплата
по договорённости
Уровень
middle
Формат
удалённо
Удалённо
да

Наша команда занимается офлайн-оценкой больших языковых моделей: как внутренних моделей Алисы, так и моделей других разработчиков. На заранее подготовленных наборах запросов мы проверяем, какие сильные и слабые стороны есть у каждой модели.

Для нас важно не только получить результаты оценки, но и обеспечить простоту самого процесса: запустить необходимые инструменты, если что-то идёт не так; разобраться в сбое; понять, что произошло с данными или логами, и сделать следующий запуск предсказуемее.

Что предстоит делать:
Прокачка моделей

Вам предстоит прокачивать наборы запросов через внутренние инструменты для оценки внутренних и внешних моделей.

Поддержка инструментов оценки

Вы будете настраивать и запускать внутренние инструменты оценки моделей, находить причины сбоев и исправлять то, что мешает работе. Также нужно будет развивать надстройки над инфраструктурой прокачки, чтобы другие аналитики могли легко делать то же самое.

Исследование новых моделей и данных

Вам нужно будет изучать особенности поведения новых моделей, разбирать непривычные данные и форматы логов. Здесь задачи меняются: вчера проблема была в данных Алисы, сегодня — в странном формате ответа новой модели, завтра — в инструменте оценки. Предстоит быстро погружаться в малознакомую систему и находить причину проблемы.

Помощь с улучшением процесса оценки

Замечать повторяющиеся ошибки, оформлять понятные баг-репорты и предлагать улучшения инструментов и процесса оценки — это также будет входить в ваши задачи.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

Требования:
• Готовы оперативно разбираться в большом количестве незнакомых инструментов, данных, логов
• Можете самостоятельно запускать и поддерживать технические процессы
• Умеете ясно описывать проблему, воспроизводить её и объяснять её суть коллегам

Будет плюсом:
• Работали с инструментами оценки моделей или качеством ответов AI-систем, слышали про v1/chat/completions, LLM-as-a-Judge
• Автоматизировали процессы и поддерживали внутренние инструменты для работы с данными

Открыть и откликнуться →

Отклик ведёт на сайт работодателя. Бесплатная регистрация открывает отклик и разбор резюме.