Ташкент, улица Истикбол, 21
Мы ищем Site Reliability Engineer (SRE), который будет обеспечивать надежность, доступность и стабильную работу production-сервисов, развивать мониторинг и автоматизацию эксплуатации.
Обязанности:
Обеспечение высокой доступности и отказоустойчивости production-систем.
Мониторинг инфраструктуры и сервисов, оперативное реагирование на инциденты.
Анализ причин инцидентов (RCA) и внедрение мер по предотвращению повторных сбоев.
Развитие систем мониторинга, логирования и алертинга.
Построение и сопровождение дашбордов, метрик и технических KPI.
Диагностика проблем производительности приложений, Kubernetes и инфраструктуры.
Автоматизация рутинных операций и процессов эксплуатации.
Поддержка и развитие CI/CD совместно с командами разработки.
Взаимодействие с разработчиками при устранении production-проблем и повышении надежности сервисов.
Участие в сопровождении Kubernetes-кластеров и контейнеризированных приложений.
Требования:
Опыт работы SRE, DevOps Engineer или System Engineer от 3 лет.
Уверенное знание Linux.
Практический опыт работы с Docker и Kubernetes.
Опыт сопровождения production-систем.
Опыт работы с Prometheus, Grafana, Loki/ELK/OpenSearch или аналогичными системами наблюдаемости.
Опыт расследования инцидентов и анализа логов.
Практический опыт с GitLab CI, Jenkins или другими CI/CD инструментами.
Опыт работы с Terraform, Ansible или другими IaC-инструментами.
Навыки написания скриптов (Bash, Python или Go).
Понимание сетевых протоколов, HTTP, DNS, TCP/IP и принципов информационной безопасности.
Опыт работы с облачными платформами (AWS, Azure или GCP) будет преимуществом.
Будет преимуществом:
Опыт работы с PostgreSQL, Kafka, RabbitMQ или другими распределенными системами.
Понимание принципов SLI/SLO/SLA.
Опыт проведения postmortem и RCA.
Опыт настройки алертинга и построения наблюдаемости сервисов.