Чем ты будешь заниматься
- разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, сервисы, базы данных;
- настраивать и оптимизировать инференс-сервисы и системы мониторинга;
- работать с облачными сервисами и управлять инфраструктурой через Terraform;
- автоматизировать деплоймент ML-сервисов и взаимодействовать с ML командой;
- поддерживать ClearML для управления эксперементами и автоматизации обучения и деплоя;
- оптимизировать CI/CD и развертывание моделей, улучшать инструменты для экспериментов и мониторинга;
- реализовать деплоймент сервисов через Helm чарты и ArgoCD.
Стек: Kubernetes, Helm, ArgoCD, Terraform
Мы ожидаем
- опыт работы в DevOps/SRE от 3 лет
- опыт работы с системами мониторинга и алертинга, создания дашбордов (Prometheus, Grafana, Loki)
- глубокое знание основ DevOps-практик и методов эффективной организации CI/CD-процессов
- опыт взаимодействия с распределенными системами, контейнерами
- высокий уровень владения Linux и сетевыми технологиями
- способность быстро находить правильные технические решения и брать ответственность за их реализацию
- хорошая ориентация в ИТ: сетях, работе с данными, протоколах интернета, RPC и другом