LLM Data Scientist — оценка качества GigaChat (модельные риски генеративных моделей)

СБЕР

LLM Data Scientist — оценка качества GigaChat (модельные риски генеративных моделей)

Описание вакансии

Наша команда отвечает за оценку модельного риска и независимый контроль генеративных моделей Банка. В нашей зоне ответственности GigaChat — текстовые и мультимодальные LLM — и open-source модели: команда первой видит, на что способна новая версия, прежде чем она выйдет к пользователям.

Нам нужен специалист, который возьмет на себя измерение качества GigaChat:

  • разработку бенчмарков и измерение на них качества модели — на собственных данных, а не по публичным лидербордам
  • развитие собственной библиотеки валидации LLM полного цикла: от сбора данных и разметки до финальных метрик и отчетов
  • вынесение заключения по модельному риску: при каких условиях версию можно выпускать и что осталось непроверенным.

Эта роль про независимое измерение фундаментального качества модели: не про обучение GigaChat — этим занимается отдельная команда — и не про продуктовые метрики вроде DAU и retention.

Обязанности

Развивать собственный фреймворк оценки LLM

  • писать чистый код фреймворка и проверять чужой: регулярные код-ревью, PR, поддержка растущей кодовой базы
  • настраивать автоматизацию и CI под растущую аудиторию и вести регулярную валидацию версий GigaChat и open-source альтернатив по единой методике — фреймворком пользуются команды по всему Банку.

Разрабатывать бенчмарки и проектировать проверку

  • разрабатывать и актуализировать собственные бенчмарки под ключевые сценарии Банка: подбор задач, редкие и намеренно трудные случаи, эталонные ответы
  • превращать запрос «модель стала лучше?» в план проверки: что измеряем, на какой выборке, с чем сравниваем.

Строить LLM-судей и автоматические метрики

  • делать судей под задачу, знать их перекосы (self-preference, position bias, length bias) и калибровать оценки против человеческих
  • понимать, где автоматическая оценка не годится и нужен другой подход, и снижать стоимость измерений без потери достоверности.

Давать заключение по модельному риску

  • оценивать автономность модели в сценарии и цену ее ошибки: что она делает без человека, что необратимого может произойти, какой худший реалистичный исход
  • формулировать условия выпуска — доля трафика, ограничения по сценариям, митигации, мониторинг — с явным перечнем непроверенного и защищать выводы перед командой разработки и руководством.

Следить за фронтиром

  • следить за новыми подходами в научном сообществе, читать статьи, писать собственные, внедрять лучшие практики оценки в процессы Банка
  • когда нужного инструмента не существует — создавать его самостоятельно.

Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.

Требования

  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой
  • статистика и дизайн эксперимента: доверительные интервалы, оценка необходимого размера выборки, проверка гипотез, поправки на множественные сравнения, разница между статистической и практической значимостью
  • понимаете, как устроены LLM изнутри: как работает трансформер и механизм внимания, почему текст разбивается на токены и к чему это приводит, как параметры генерации влияют на ответ, чем отличаются этапы обучения — предобучение, дообучение на инструкциях и обучение на человеческих предпочтениях
  • опыт работы с LLM и понимание, как оценивают генеративные модели: метрики, human evaluation, LLM-as-a-judge и его ограничения
  • привычка выяснять цену ошибки до начала работы — не бросаться считать метрики, не поняв, что именно проверяете
  • Готовность работать без готовой методологии, проактивность, умение декомпозировать большие задачи на решаемые.

Будет плюсом:

  • опыт с open-source моделями и инференсом: vLLM, SGLang, inference API, prompt engineering
  • опыт работы с мультимодальными моделями: изображения, аудио
  • опыт построения evaluation-фреймворков и evaluation harness, встраивание оценок в CI/CD
  • работа с асессорами: постановка задачи разметчикам, контроль согласованности разметки
  • работа с coding-агентами (Claude Code, Codex, Cursor и аналоги)
  • представление о том, как удешевляют инференс: квантизация, дистилляция, PEFT/LoRA, спекулятивное декодирование
  • опыт с RAG: умеете оценивать поиск и генерацию по отдельности, понимаете, почему модель выдумывает факты и как на это влияют разбиение документов на фрагменты и их ранжирование; работали с векторным поиском и эмбеддингами.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • возможность выбрать удобный график — офис / гибрид
  • ежегодный пересмотр зарплаты и годовая премия по итогам работы 2–4 оклада
  • программа адаптации и помощь руководителя на старте
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • корпоративный спортзал и зоны отдыха
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трех близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
Посмотреть контакты работодателя

Похожие вакансии

СБЕР
  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

АстраЗенека

Middle/Senior Data Scientist

АстраЗенека

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Лучи
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

АНО ЦИСМ
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Мокка
  • Москва

  • Не указана

СБЕР

Data engineer

СБЕР

  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию