Чем предстоит заниматься:
Управление ML-инфраструктурой:
- Администрирование и развитие систем оркестрации экспериментов и обучения моделей;
- Поддержка и развитие сервисов для управления ML workflows;
- Работа с системами версионирования данных и моделей;
- Мониторинг и поддержка систем инференса моделей.
DevOps и автоматизация:
- Развертывание и поддержка ML-сервисов в контейнеризованной среде;
- Настройка CI/CD процессов для ML-проектов;
- Мониторинг инфраструктуры и производительности ML-систем;
- Автоматизация развертывания и управления ML-пайплайнами.
Разработка и стандартизация:
- Участие в разработке внутренних инструментов для упрощения MLOps процессов;
- Создание документации и регламентов для работы с ML-артефактами;
- Поддержка распределенного обучения моделей.
Что мы ждем от кандидата:
- Опыт работы с MLOps инструментами (ClearML, MLflow, Kubeflow или аналогичными) от 1 года;
- Уверенное владение Python для разработки сервисов и автоматизации;
- Опыт работы с контейнеризацией и оркестрацией (Docker, Kubernetes);
- Опыт работы с GPU инфраструктурой в kubernetes;
- Понимание CI/CD процессов и опыт их настройки;
- Хорошее процессов понимание машинного обучения и жизненного цикла ML-моделей;
- Опыт разработки веб-сервисов и API;
- Знание Linux и навыки системного администрирования.
Будет плюсом: