Аналитик-разработчик по оценке качества LLM в Яндекс R&D

Яндекс

Аналитик-разработчик по оценке качества LLM в Яндекс R&D

Москва, Центральный административный округ, район Хамовники, квартал Красная Роза

Метро: Парк культуры

Описание вакансии

Мы расширяем команду. Ищем аналитика, который возьмёт на себя контур замеров: запуск приёмок, контроль прохождения разметки и анализ результатов.

Вы увидите изнутри всю кухню оценки качества LLM — от состава оценочных наборов до критериев, по которым релиз останавливают. Процесс активно автоматизируется: рутина будет уходить, а ваша роль — расти в сторону анализа и методологии. Вы будете работать бок о бок с ML-инженерами качества, доменными экспертами и командой краудсорса.

Какие задачи вас ждут

Организация приёмок новых версий моделей
В ваши обязанности войдёт подготовка оценочных наборов, постановка задач по всем аспектам качества, настройка и запуск пайплайнов оценки.

Приёмки проходят несколько раз в неделю, они идут параллельно и зависят от дат релизов, поэтому очень важно их все контролировать.

Контроль разметки
Замер действует неделю и проходит через несколько команд и пулов. Вам предстоит следить за его статусом, выявлять и устранять сбои, а также отслеживать недоставленные или потерянные данные. Нужно будет разбираться в причинах и доводить модель до работающего результата вместе с командой краудсорса и соседними командами. Это та часть работы, где аккуратность и въедливость дают больше всего.

Сбор и анализ результатов
Вы будете сводить результаты всех аспектов в одну картину: считать значимость, отличать настоящее изменение от шума, объяснять расхождения между аспектами и между людьми и автоматическими оценщиками.

По каждому релизу должно быть заключение с разбором сценариев и конкретными примерами; раз в неделю — сводка по всем замерам для ML-команд и продукта.

Развитие процесса
Параллельно мы автоматизируем приёмку и строим под неё инструменты. Вы будете главным заказчиком и первым пользователем этой автоматизации: приносить требования, обкатывать новое и забирать себе те задачи, которые она освобождает.

Мы ждём, что вы

  • Уверенно работаете с Python и SQL
  • Знаете математическую статистику и теорию вероятностей
  • Доводите до конца многошаговые процессы с внешними зависимостями: чужие пайплайны, пулы разметки, сроки соседних команд
  • Умеете формулировать обоснованное заключение по данным и защищать его перед заказчиками
  • Самостоятельны и готовы браться за новые задачи, для которых нет готового решения
  • Интересуетесь развитием LLM и хотите глубоко погрузиться в тему

Будет плюсом, если вы

  • Проводили оценку качества LLM с использованием голден-сетов, LLM-as-a-Judge и контроля разметки
  • Работали на стыке офлайн-оценки и онлайн-экспериментов
  • Занимались оценкой агентских сценариев и мультимодальных моделей
  • Применяли NLP, краудсорсинговые разметки и ML
Навыки
  • Python
  • SQL
  • Теория вероятностей
  • Математическая статистика
  • llm
Посмотреть контакты работодателя

Адрес

Похожие вакансии

Яндекс
  • Москва

  • Не указана

Рекомендуем
Ozon
  • Москва

  • Не указана

Рекомендуем
YADRO
  • Москва

  • Не указана

Профи.ру

Тимлид в BI

Профи.ру

  • Москва

  • Не указана

2ГИС
  • Москва

  • Не указана

Росагролизинг
  • Москва

  • Не указана

Литрес
  • Москва

  • Не указана

Группа компаний Агротек
  • Москва

  • Не указана

Домклик
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию