Ведущий специалист мониторинга и дежурной службы эксплуатации

Ведущий специалист мониторинга и дежурной службы эксплуатации

Описание вакансии

Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.

Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.

Ищем ведущего специалиста, который станет одной из опор круглосуточной дежурной службы: будет не просто реагировать на алерты, а глубоко разбираться в инцидентах, помогать команде стабилизировать сервисы и участвовать в развитии процессов мониторинга. Вы будете работать на стыке эксплуатации и инженерии: диагностировать проблемы в реальном времени, координировать смежные команды, снижать количество ложных срабатываний и улучшать наблюдаемость систем. Роль предполагает самостоятельность в принятии решений в рамках регламентов, наставничество для дежурных инженеров и участие в проработке архитектурных улучшений.

Задачи

  • Оперативно реагировать на инциденты в рамках SLA: принимать алерты, проводить первичную диагностику, запускать процессы эскалации, координировать вовлечённые команды, контролировать закрытие инцидента.
  • Проводить глубокий разбор инцидентов: выявлять корневые причины, фиксировать шаги решения, формировать короткие отчёты для команды и предложения по предотвращению повторов.
  • Настраивать и поддерживать мониторинг: актуализировать алерты и пороги срабатывания, снижать «шум», добавлять новые метрики для проактивного выявления рисков, участвовать в создании дашбордов.
  • Развивать наблюдаемость: помогать внедрять логирование, трейсинг и структурированные алерты там, где это критично для скорости диагностики.
  • Автоматизировать типовые действия дежурных: писать скрипты (Bash, Python), настраивать интеграции с тикет‑системами и мессенджерами, создавать и актуализировать runbooks/playbooks.
  • Консультировать и обучать дежурных инженеров: разбирать сложные кейсы, помогать осваивать инструменты и регламенты, участвовать в передаче смен и разборе дежурств.
  • Участвовать в планировании изменений, влияющих на доступность: согласовывать окна работ, контрольные точки мониторинга, сценарии отката при проблемах.
  • Формировать оперативную отчётность: сводки по инцидентам за смену/неделю, статистику по MTTR, доле инцидентов в SLA, количеству ложных алертов, динамике нагрузки.
  • Взаимодействовать со смежными командами (DevOps, SRE, разработка, ИБ): фиксировать требования к наблюдаемости, согласовывать процедуры реагирования, участвовать в совместных учениях.
  • Вести и актуализировать документацию: регламенты дежурств, матрицы ответственности, инструкции по типовым инцидентам, базу знаний.

Требования

  • Опыт работы в эксплуатации, дежурной службе или мониторинге от 3 лет, понимание процессов 24×7 и регламентов реагирования.
  • Уверенное владение инструментами мониторинга и алертинга (Prometheus, Grafana, Zabbix, Nagios, ELK/Loki и аналоги) и умение настраивать алерты под реальные бизнес‑риски.
  • Практические навыки диагностики в Linux‑среде: анализ логов, метрик, сетевых проблем, работы контейнеров и сервисов.
  • Понимание жизненного цикла инцидента и базовых метрик эффективности (MTTR, MTBF, SLA/SLO, доля инцидентов в SLA).
  • Базовые навыки автоматизации: Bash, Python (или другой скриптовый язык) для типовых задач дежурного.
  • Знание сетевых основ (TCP/IP, DNS, HTTP, TLS) и принципов работы высокодоступных и распределённых систем.
  • Умение чётко и быстро фиксировать информацию, писать понятные отчёты и инструкции для команды.
  • Хорошие коммуникативные навыки: способность спокойно и структурированно взаимодействовать с разработчиками, инженерами и менеджерами в стрессовых ситуациях.
  • Готовность к дежурствам и оперативному включению в инциденты, в том числе в нерабочее время.

Что предлагаем

  • Конкурентную заработную плату — уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
  • ДМС — заботимся о здоровье сотрудников и предоставляем расширенные программы
  • Обучение и развитие — доступ к курсам, профессиональным программам и внутреннему обучению
  • Карьерный рост — возможности развиваться в своей специализации и переходить на новые направления
  • Интересные IT-задачи — участие в проектах, которые напрямую влияют на развитие крупного бизнеса
  • Современный стек и технологии — возможность работать с актуальными инструментами и подходами
  • Гибкий формат работы — обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
  • Сильная команда — работа с опытными специалистами из IT и смежных бизнес-направлений
  • Стабильность — крупная компания с масштабными проектами и долгосрочными планами развития
  • Корпоративные бонусы — скидки на продукцию компании и дополнительные программы для сотрудников
  • Комфортные условия работы — современная рабочая среда, необходимые инструменты и всё для эффективной работы
Посмотреть контакты работодателя

Похожие вакансии

Начальник отдела мониторинга и дежурной службы эксплуатации

Крупная российская компания с развитым бизнесом и собственными IT-решениями

  • Москва

  • Не указана

Рекомендуем
МАГНИТ, Розничная сеть

Ведущий инженер сопровождения

МАГНИТ, Розничная сеть

  • Москва

  • Не указана

Рекомендуем

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию