ML Engineer в команду Disrupt

СБЕР

ML Engineer в команду Disrupt

Описание вакансии

Мы - команда Disrupt в Сбере, часть блока ГенИИ. Отвечаем за все новые воплощения Гиги на рынках и работаем в формате фабрики гипотез: ищем перспективные сценарии, запускаем MVP, масштабируем лучшие продукты.

Ищем ML-инженера, который будет запускать в продакшен и ускорять большие языковые модели на инфраструктуре NVIDIA.

Обязанности

  • Запускать и поддерживать распределённый инференс LLM на кластере GPU.
  • Тюнить движки (vLLM, SGLang, TensorRT-LLM или аналоги) для максимальной скорости и утилизации железа.
  • Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях.
  • Применять квантизацию (FP8/INT8), speculative decoding и другие оптимизации без потери качества ответов.
  • Находить узкие места по памяти (VRAM/HBM) и сети (NVLink/InfiniBand), устранять OOM и сбои узлов.
  • Упаковывать сервисы в Kubernetes/Docker, настраивать автоскейлинг, выкаты и откаты.
  • Строить мониторинг метрик вывода (задержки, токены/сек, стоимость за 1М токенов).
  • Проводить нагрузочное тестирование и планировать мощности.

Требования

  • От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде. Обязательно хотя бы один свой GPU-сервис, доведенный до продакшена.
  • Уверенное владение Python и Linux. Знание Docker, Git, CI/CD и базовая работа с Kubernetes.
  • Практический опыт запуска моделей на PyTorch под NVIDIA GPU.
  • Опыт работы минимум с одним production-стеком для инференса (vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналоги).
  • Понимание того, как устроена память GPU, что такое mixed precision, батчинг, KV-кэш и параллелизм моделей.
  • Умение замерять производительность, читать профилировщики (PyTorch Profiler, Nsight, DCGM) и находить баланс между скоростью, качеством ответов и стоимостью вывода.
  • Базовое понимание распределенных систем: таймауты, повторы запросов, отказоустойчивость при падении узла и выкат без простоев.

Будет плюсом:

  • Умение писать CUDA/Triton kernels, работать с NCCL и быстрой связкой узлов (NVLink/InfiniBand, GPUDirect/RDMA).
  • Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом.
  • Знакомство с KServe или Ray Serve; сбор метрик через Prometheus/Grafana, GPU Operator или DCGM Exporter.
  • Навыки конвертации весов моделей, проведения quantization-aware evaluation и сравнения разных движков инференса.
  • Базовый C++ или Go для написания быстрых компонентов control/data plane.

Условия

  • комфортный современный офис рядом с м. Кутузовская
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • система обучения для профессионального и карьерного развития
  • расширенный полис ДМС с первого дня работы и страхование для семьи
  • льготная программа ипотеки для сотрудников
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.
Посмотреть контакты работодателя

Похожие вакансии

СБЕР
  • Москва

  • Не указана

Рекомендуем
Okko
  • Москва

  • Не указана

Рекомендуем
Okko
  • Москва

  • Не указана

Рекомендуем

ML/AI Инженер

СМОТРИМ (ООО Платформа Трим)

  • Москва

  • Не указана

МАГНИТ, Розничная сеть

ML-инженер

МАГНИТ, Розничная сеть

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

АНО ЦИСМ
  • Москва

  • Не указана

АНО ЦИСМ
  • Москва

  • Не указана

СБЕР
  • Москва

  • от 250000 RUR

Digital Chief

ML Engineer

Digital Chief

  • Москва

  • от 250000 RUR

СБЕР
  • Москва

  • от 250000 RUR

Платежное Решение

ML Инженер

Платежное Решение

  • Москва

  • от 250000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию