Направление работы:
ML Platform – платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек – это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс – порядка 400–500K RPS, десятки инстансов Triton.
Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем – строим общую мультитенантную ML-платформу для всего отдела.
Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.
Стань частью команды!
Вам предстоит:
Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;
Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;
Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;
Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;
Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);
Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;
Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.
Формат работы - гибридный или удаленный по договоренности с руководителем.
Вы нам подходите, если:
Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);
Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;
Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);
Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;
Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;
Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;
Будет плюсом:
Опыт с Triton Inference Server, vLLM, KServe или аналогами;
Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;
Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);
Сторадж под данные обучения: S3, Ceph, NFS;
Multi-node training: NCCL, InfiniBand, RDMA.
Москва
Не указана