Москва
Метро: Библиотека им.ЛенинаПроектированием и развитием cloud‑first инфраструктуры, которая одинаково надёжно работает как для ML‑задач (GPU‑кластеры, инференс), так и для микросервисного окружения.
Построением и оптимизацией CI/CD пайплайнов в GitLab CI — кэширование, управление артефактами, параллелизация, сокращение времени сборки.
Деплоем, отладкой и масштабированием кластеров Kubernetes (kubeadm/k0s), включая настройку Ingress, HPA/VPA, Network Policies, работу с Helm-чартами.
Управлением частными облаками на базе OpenStack — развёртывание, конфигурация, мониторинг ресурсов, работа с проектами и квотами.
Настройкой систем мониторинга и наблюдаемости: Prometheus + Grafana (дашборды, алертинг), Loki для логов, внедрение SLO/SLI и отслеживание их выполнения.
Реализацией инфраструктуры как кода (IaC) с помощью Terraform/Terragrunt — разработка модулей, управление состоянием (state), удалённые бэкенды, интеграция с Ansible для конфигурации.
Обеспечением безопасности на всех уровнях: управление секретами (Vault / Sealed Secrets), настройка RBAC, сетевых политик, hardening ОС и кластера.
Администрированием Linux-серверов, диагностикой производительности, написанием скриптов на Bash и Python для автоматизации рутинных задач.
Участием в on‑call-ротации (при этом мы стремимся к нулевым инцидентам благодаря проактивному мониторингу и автовосстановлению).
Чего ожидаем от тебя:
Опыт коммерческой работы от 5 лет в роли DevOps / SRE / Platform Engineer.
Глубокое знание GitLab CI: построение сложных пайплайнов, стратегии кэширования, работа с артефактами и зависимостями.
Экспертное владение Kubernetes: установка и конфигурация кластеров (kubeadm/k0s), отладка подов, горизонтальное и вертикальное масштабирование, работа с Ingress-контроллерами, сетевыми политиками.
Опыт работы с OpenStack: управление проектами, инстансами, сетями, хранилищами.
Настройка мониторинга на базе Prometheus + Grafana: разработка дашбордов, настройка алертов, работа с Loki, понимание SLO/SLI.
Практика с Terraform/Terragrunt: модульная структура, управление state, использование remote backends, и Ansible для конфигурации серверов.
Знание инструментов безопасности: Vault / Sealed Secrets для секретов, тонкая настройка RBAC, Network Policies, hardening Linux и Kubernetes.
Уверенное администрирование Linux, умение диагностировать проблемы (нагрузка, сеть, диски), писать скрипты на Bash и Python.
Самостоятельность в постановке задач, проактивный поиск узких мест, отличная коммуникация с разработчиками и коллегами.
Опыт с GitOps (ArgoCD / FluxCD) — управление декларативными состояниями.
Углублённые навыки в безопасности: работа с Vault, SOPS, политики OPA/Gatekeeper.
Мультипроектность — умение вести инфраструктуру для нескольких продуктов одновременно.
Что готовы предложить:
Реальные задачи на стыке DevOps и MLOps — редкое сочетание для профессионального роста.
Развитие и обучение: предсказуемый онбординг, помощь наставника; оплата тренингов, семинаров и конференций, корпоративная библиотека.
Стабильность и прозрачность: оформление по ТК, пересмотры зарплаты по итогам performance review.