Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)

2ГИС

Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)

Описание вакансии

2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.

Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.

Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.

Чем предстоит заниматься

Развивать Incident & Problem Management

  • внедрять и развивать единый процесс управления инцидентами;
  • формировать культуру postmortem-разборов без поиска виноватых;
  • контролировать выполнение action items, направленных на предотвращение повторных сбоев;
  • улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.

Развивать observability

  • стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;
  • участвовать в создании единой платформы мониторинга и визуализации;
  • разрабатывать стандарты логирования;
  • контролировать объём и качество данных, поступающих в системы телеметрии.

Трансформировать подход к алертингу

  • проводить аудит существующих алертов и снижать число ложных срабатываний;
  • формировать единые принципы приоритизации алертов с учётом критичности сервисов;
  • помогать командам настраивать полезные, своевременные и понятные уведомления.

Внедрять SRE-практики и повышать зрелость команд

  • участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;
  • помогать командам определять и внедрять SLO/SLA;
  • создавать дашборды для контроля Error Budget;
  • разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;
  • консультировать продуктовые команды по вопросам стабильности и надёжности.

Автоматизировать процессы

  • формировать требования к развитию платформы дежурств и интеллектуальной эскалации;
  • внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков.

Мы ожидаем, что ты

  • Работаешь в SRE или DevOps от 3 лет.
  • Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability.
  • Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana.
  • Работал с OpenTelemetry или аналогичными инструментами.
  • Автоматизируешь процессы на Python, Go, Bash или другом языке.
  • Понимаешь принципы работы on-call-ротаций и систем управления инцидентами.
  • Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения.
  • Знаком с CI/CD, Kubernetes и контейнеризацией.

Будет плюсом, если ты

  • Внедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании.
  • Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности.

Что предлагаем

  • Возможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие.
  • Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей.
  • Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми.
  • Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов.
  • ИТ-акредитацию.
  • Удаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).
Навыки
  • SRE
  • DevOps
  • Prometheus
  • Grafana
  • Python
  • Golang
  • CI/CD
  • Kubernetes
Посмотреть контакты работодателя

Похожие вакансии

NGENIX
  • Москва

  • Не указана

Рекомендуем
K2 Тех
  • Москва

  • Не указана

Рекомендуем
Группа Лоджик Старс
  • Москва

  • Не указана

Рекомендуем
Aston

Team Lead

Aston

  • Москва

  • Не указана

YADRO
  • Москва

  • Не указана

Playerok
  • Москва

  • от 270000 RUR

РДП Энтерпрайз
  • Москва

  • от 270000 RUR

РДП Энтерпрайз

Tech Lead (PCEF)

РДП Энтерпрайз

  • Москва

  • от 250000 RUR

Объединенное Кредитное Бюро

Senior DevOps инженер

Объединенное Кредитное Бюро

  • Москва

  • от 250000 RUR

СДЭК
  • Москва

  • от 250000 RUR

Медиа Ком

IT Team Lead / Техлид

Медиа Ком

  • Москва

  • до 280000 RUR

Юрент

Team Lead DevOps

Юрент

  • Москва

  • до 280000 RUR

ГНИВЦ
  • Москва

  • до 280000 RUR

Черкизово, Группа предприятий

Ведущий консультант SAP HCM (PY)

Черкизово, Группа предприятий

  • Москва

  • до 280000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию