Мы ищем инженера, который будет отвечать за стабильную работу ML-инфраструктуры и сервисов инференса в production.
В этой роли предстоит настраивать и поддерживать Triton Inference Server, работать с Kubernetes и CI/CD, следить за стабильностью ML-сервисов и пайплайнов, разбирать инциденты и постепенно улучшать инфраструктуру.
В нашей команде тебе предстоит:
- Настраивать и поддерживать NVIDIA Triton Inference Server для production-нагрузки;
- Загружать и обновлять модели в Triton, настраивать model repository, версии моделей и параметры инференса;
- Поддерживать и развивать CI/CD для моделей и ML-сервисов;
- Настраивать Kubernetes-ресурсы: CPU, GPU, memory, requests/limits, autoscaling и deployment'ы;
- Поддерживать DAG'и и пайплайны, разбирать и устранять возникающие проблемы;
- Диагностировать инциденты: миграция базы, проблемы с сервисами, нехватка памяти/CPU/GPU, падения pod'ов и другие production-проблемы;
- Следить за состоянием сервисов по дашбордам, метрикам и логам;
- Анализировать логи и метрики: определять, что именно сломалось, когда началась проблема и где находится её первопричина;
- Участвовать в устранении технического долга и развитии инфраструктуры;
- Переводить существующие процессы на более современные инструменты, в том числе участвовать в миграции на MLflow;
- Автоматизировать повторяющиеся операции и снижать количество ручных действий при эксплуатации ML-сервисов.
Что мы ожидаем от кандидата: - Уверенное знание Linux и понимание принципов эксплуатации production-сервисов;
- Практический опыт работы с Kubernetes: deployments, pods, requests/limits, probes, ConfigMap/Secret, volumes, ресурсы и troubleshooting;
- Опыт настройки и эксплуатации CI/CD;
- Понимание принципов работы ML-инференса и жизненного цикла ML-модели в production;
- Опыт работы с Triton Inference Server или близкими системами model serving;
- Умение читать и анализировать логи и метрики, находить причину проблем, а не только перезапускать сервис;
- Базовое понимание мониторинга: Prometheus/Grafana или аналогичные инструменты;
- Опыт работы с Python и/или Bash для автоматизации;
- Умение самостоятельно разбираться в незнакомой инфраструктуре и доводить проблему до решения.
Будет плюсом:
- Опыт работы с GPU в Kubernetes: NVIDIA device plugin, GPU requests/limits, CUDA;
- Опыт оптимизации ML-инференса и понимание latency/throughput/batching;
- Знание MLflow и практический опыт работы с Model Registry;
- Опыт с Airflow или другими системами оркестрации DAG'ов;
- Опыт работы с Prometheus, Grafana, Loki/ELK и системами алертинга.
- Знание Helm, Terraform или Argo CD;
- Опыт эксплуатации ML-платформ или большого количества ML-сервисов в production.
Условия:
- Возможность работать удалённо или в гибридном формате;
- Гибкий график работы;
- Официальное оформление с "белой" ЗП, ежеквартальные и годовые премии по результатам работы;
- Удобный офис рядом с м. «Добрынинская» или удаленную работу;
- Широкий пакет ДМС (включая выезд за рубеж и стоматологию), страхование жизни и здоровья;
- Возможность учиться и развиваться за счёт компании: внешние тренинги и семинары по профессиональным тематикам, участие в крупнейших конференциях страны, программы развития цифровых и управленческих навыков (Цифровая академия, Школа Тимлидов), онлайн и офлайн мастер-классы, корпоративный университет «X5 Полка», школа наставников и многое другое;
- Программы мотивации для спикеров и авторов: внутренняя школа Speak Up School, Write Up, ачивки и баллы за выступления, подготовка спикеров к крупнейшим конференциям страны, сообщество авторов на Хабре, возможность шерить опыт с комьюнити внутренних и внешних экспертов;
- Обмен опытом через cообщества: 12 технических комьюнити от java до devops;
- Яркая корпоративная жизнь с большим количеством мероприятий, конкурсов и возможностей для творческой реализации: регулярные внутренние митапы, демо-дни, открытые микрофоны, день IT-специалиста, программы волонтерства, корпоративное предпринимательство X5 Idea Challenge;
- Забота о благополучии сотрудников: 7 спортивных сообществ (бег, футбол, волейбол, баскетбол, хоккей, лыжи, триатлон), ежегодная Неделя здоровья;
- Скидки в экосистеме бизнесов Х5 («Пятёрочка», «Перекрёсток», «Много лосося», «Перекресток Впрок»);
- Программа привилегий Prime-zone (скидки на товары и услуги и специальные предложения от компаний-партнёров);
- Материальная помощь сотрудникам, попавшим в сложную жизненную ситуацию.