Incident Commander (SRE / NOC Lead)

билайн

Incident Commander (SRE / NOC Lead)

Описание вакансии

Ищем опытного Incident Commander — человека, который управляет самыми сложными авариями в нашей сети и сервисах. Это не роль «дежурного инженера». Это роль лидера, принимающего решения в условиях неопределённости и высокой цены ошибки.

Что тебе предстоит:

  • Управлять критическими инцидентами уровня P1/P2, выполняя роль Incident Commander по модели IC-DC-SMC и координируя работу кросс-функциональных команд.
  • За 2–3 минуты оценивать severity, организовывать WAR Room, определять стратегию реагирования и приоритеты: stop the bleed → stabilization → RCA → root cause remediation.
  • Координировать выполнение мероприятий по восстановлению сервисов, принимая совместно с инженерными командами решения об откате релизов, failover ЦОДа, переключении трафика, частичной деградации сервисов и других мерах по снижению влияния инцидента.
  • Вести incident timeline (detection → response → mitigation → resolution) в Jira, PagerDuty, Opsgenie и обеспечивать регулярную коммуникацию со стейкхолдерами и бизнесом.
  • Организовывать проведение blameless postmortem, выполнять RCA и контролировать реализацию action items.
  • Развивать процессы Incident Management: совершенствовать runbooks, playbooks, процессы on-call-ротации, организовывать Game Days и chaos engineering, анализировать и улучшать показатели MTTD, MTTR, MTBF, SLI/SLO attainment.
  • Обучать новых Incident Commander, проводить ретроспективы и внедрять лучшие практики управления инцидентами.

Что для нас важно:

  • Опыт управления критическими инцидентами (P1/P2) в высоконагруженной или распределенной ИТ-инфраструктуре.
  • Уверенное понимание сетевых технологий (TCP/IP, BGP, MPLS, DNS, HTTP/S), архитектуры LTE/5G Core, принципов работы Linux и инженерных инструментов диагностики (strace, tcpdump, iostat, journalctl).
  • Опыт работы с инструментами Observability: Prometheus, Grafana, Zabbix, ELK/OpenSearch, Jaeger/Zipkin.
  • Понимание процессов CI/CD, стратегий релизов (Canary, Blue-Green), жизненного цикла Kubernetes Pods, Helm, а также принципов работы PostgreSQL (connection pool, replication lag), Redis и Kafka.
  • Знание процессов ITIL/ITSM (Event → Incident → Problem → Change Management).
  • Умение принимать решения в условиях высокой неопределенности, эффективно управлять несколькими потоками работ (debug, escalation, communications, stakeholders, timeline), выстраивать коммуникацию с бизнесом и техническими командами, демонстрировать leadership without authority и придерживаться blameless mindset.
Будет преимуществом:
  • Опыт работы в telecom или крупных распределенных сервисах (e-commerce, cloud provider, CDN).
  • Практический опыт проведения Game Days, chaos engineering и fault injection (Gremlin, Chaos Mesh, Litmus).
  • Знакомство с требованиями РКН, 152-ФЗ, СОРМ.
  • Опыт подготовки RCA или postmortem, повлиявших на архитектуру сервиса и повышение его надежности.

Что мы предлагаем:

  • Реальная ответственность и влияние на надёжность сервисов миллионов абонентов
  • Обучение: бюджеты на конференции, курсы, сертификации (CKA, AWS SAA, SRE Foundation)
  • Современный стек: k8s, Terraform, GitOps, собственный observability platform
  • Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+.
  • Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж.
  • Материальную помощь.
  • Детские подарки.
  • Доплату по листу нетрудоспособности
  • Корпоративные скидки на товары и услуги от партнеров компании.
  • Служебную сотовую связь.
  • Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока.
  • Удалёнка / гибрид / офис — на выбор.
Навыки
  • SRE
  • Управление критическими инцидентами
  • Координация работы кросс-функциональных команд
  • Incident timeline
  • Incident Management
  • Сетевые технологии
  • Понимание процессов CI/CD
  • ITIL/ITSM
Посмотреть контакты работодателя

Похожие вакансии

СБЕР
  • Москва

  • Не указана

Рекомендуем
билайн
  • Москва

  • Не указана

Рекомендуем
Си-Эн-Эс
  • Москва

  • Не указана

Рекомендуем
BI.ZONE
  • Москва

  • Не указана

Senior DevOps

Лектон

  • Москва

  • Не указана

Фалькон Тех

Senior DevOps инженер

Фалькон Тех

  • Москва

  • Не указана

РДП Энтерпрайз

Tech Lead (PCEF)

РДП Энтерпрайз

  • Москва

  • Не указана

Лаборатория Касперского

Senior Linux Engineer (Kubernetes)

Лаборатория Касперского

  • Москва

  • Не указана

Объединенное Кредитное Бюро

Senior DevOps инженер

Объединенное Кредитное Бюро

  • Москва

  • Не указана

АФЛТ-Системс
  • Москва

  • Не указана

Защищенные Телекоммуникации

Системный архитектор / Senior System Architect

Защищенные Телекоммуникации

  • Москва

  • Не указана

Neoflex
  • Москва

  • Не указана

ИНФОРМЗАЩИТА
  • Москва

  • Не указана

  • Москва

  • Не указана

Главный специалист по информационной безопасности

Московская компания в сфере финансового анализа

  • Москва

  • Не указана

Altenar
  • Москва

  • Не указана

ТЕЛЕРУС
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию