О проекте: Ищем DevOps-инженера, который возьмет на себя полную ответственность за надежность, доступность и отказоустойчивость сервисов в production-среде в соответствии со стандартами SLA/SLO. В ключевые задачи войдут развитие современной системы observability (метрики, логи, трейсы), участие в оперативных дежурствах, а также глубокое расследование инцидентов с поиском их первопричин и фиксацией опыта в постмортемах для защиты от повторных аварий.
Стек: CI/CD и автоматизация: Jenkins, GitLab CI, Ansible
Контроль версий и качество кода: Git, SonarQube, Nexus
Сборка: Maven, Gradle, NPM
Контейнеризация и оркестрация: Docker, Kubernetes/OpenShift, Docker Swarm
Service mesh: Istio
Данные и интеграции: PostgreSQL, Kafka, Redis
BPM/workflow: Camunda
ОС: Linux (Ubuntu/Debian)
Наблюдаемость: Prometheus, Grafana, Grafana Tempo, OpenTelemetry, Zabbix
Чем предстоит заниматься:
Поддерживать стабильность и доступность сервисов в production
Следить за состоянием сервисов в режиме реального времени, реагировать на инциденты и минимизировать время недоступности
Обеспечивать соответствие SLA/SLO, участвовать в дежурствах (on-call)
Расследовать инциденты, находить root cause и устранять аварии
Быстро локализовать проблему, устранить её и зафиксировать в постмортеме, чтобы она не повторилась (анализировать цепочку событий, а не только симптомы)
Проектировать и развивать наблюдаемость (observability)
Развивать систему метрик, логов, трейсов, алертинга и дашбордов на базе Prometheus, Grafana, Grafana Tempo, OpenTelemetry и т.д
Улучшать существующие алерты, убирать шум, закрывать «слепые пятна» в мониторинге
Помогать командам разработки и эксплуатации
Выступать точкой экспертизы при расследовании нештатных ситуаций: помогать читать логи, интерпретировать метрики, находить узкие места
Работать на стыке команд, чтобы проблемы решались быстрее и системнее
Что мы ждем:
Система Безопасных Коммуникаций
Москва
Не указана