Разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, inference-сервисы, прикладные сервисы и необходимые инфраструктурные компоненты.
Проектировать, настраивать и оптимизировать инфраструктуру для ML/LLM inference, обеспечивать масштабирование, отказоустойчивость и эффективное использование вычислительных ресурсов.
Автоматизировать развертывание ML-сервисов и моделей с использованием Helm, ArgoCD и CI/CD, развивать GitOps-подходы.
Управлять инфраструктурой и облачными ресурсами через Terraform, разрабатывать и поддерживать Terraform-модули.
Развивать мониторинг и observability ML-систем: метрики, логирование, алертинг, контроль доступности и производительности inference-сервисов.
Совместно с ML- и backend-разработчиками улучшать процесс вывода решений из эксперимента в production и инструменты для разработки, тестирования и эксплуатации ML-систем.
Мы ожидаем
опыт 3+ лет в DevOps/MLOps или ML-разработке;
владение Kubernetes и облачными технологиями;
навыки работы с Helm, ArgoCD и написание Terraform-модулей;
практика работы с мониторингом, логированием и ML-инференс серверами.