Обязанности:
- Администрировать и развивать **виртуализацию (Proxmox VE)** и **Ceph** — HA-кластеры, миграции, диагностика;
- Управлять **Kubernetes (HA-кластеры)** и **Helm/Argo CD** — GitOps-подход;
- Строить и сопровождать **CI/CD на GitLab** — пайплайны, сборка и публикация Docker-образов;
- Работать с **Nexus Repository** — Docker- и пакетные репозитории, cleanup policies;
- Настраивать мониторинг и оповещения — **Prometheus, Grafana, Loki, Alertmanager**;
- Участвовать в расследовании инцидентов (RCA), планировать изменения и rollback;
- Писать **Bash/Python** для автоматизации;
- Готовить документацию: схемы, регламенты, инструкции.
Требования:
- Linux — уверенное администрирование, диагностика, сеть;
- Proxmox VE — VM/LXC, HA, live migration, backup/restore, cloud-init;
- Ceph— OSD/MON/MGR, pools/PG, CephFS/RBD, CRUSH, диагностика HEALTH_WARN;
- Docker— compose, registry, volumes, networks;
- GitLab CI/CD — .gitlab-ci.yml, stages, rules, runners, окружения;
- Kubernetes — развёртывание HA-кластера, Pod/Service/Ingress/RBAC/NetworkPolicy;
- Helm*— charts, upgrade/rollback;
- Argo CD / GitOps— sync, auto-sync, app-of-apps;
- Nginx / Ingress / TLS — маршрутизация, сертификаты;
- Мониторинг - Prometheus, Grafana, Loki, PromQL/LogQL;
- PostgreSQL— базовая диагностика, backup/restore, locks;
- Сети — DNS, маршрутизация, NAT, VLAN, tcpdump;
- Nexus Repository — Docker/пакетные репозитории, права доступа;
- Production-эксплуатация — RCA, планирование простоев, rollback;
- Backup/восстановление — RPO/RTO, проверка восстановления;
- Bash + Python — автоматизация, API Proxmox/GitLab/Kubernetes;
- Безопасность— секреты, RBAC, SSH, принцип наименьших привилегий;
- Документирование — схемы, регламенты, отчёты по инцидентам.
Условия:
Премия по итогам года (13-я заработная плата);
Расскажите в сопроводительном письме о самом сложном инциденте, который вы расследовали, и что сделали, чтобы он не повторился.