Начальник отдела мониторинга и дежурной службы эксплуатации

Начальник отдела мониторинга и дежурной службы эксплуатации

Описание вакансии

Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.

Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.

Ищем руководителя, который выстроит и возглавит работу круглосуточной дежурной службы и системы мониторинга. Ваша ключевая цель — обеспечить стабильную работу сервисов за счёт своевременного выявления инцидентов, чёткой организации дежурств, прозрачных процессов реагирования и регулярной отчётности. Вы будете отвечать не только за оперативное устранение сбоев, но и за развитие процессов, снижение количества и длительности инцидентов, а также за повышение зрелости службы мониторинга.

Задачи

  • Организовать и руководить работой дежурной службы 24×7: графики дежурств, ротация, эскалации, передача смен, контроль исполнения регламентов
  • Выстроить процессы мониторинга и реагирования на инциденты: SLA по времени обнаружения и устранения, матрицы эскалации, чек‑листы действий дежурных, сценарии автоуведомлений
  • Настроить и поддерживать систему мониторинга: ключевые метрики (uptime, latency, ошибки, нагрузка), алерты, дашборды, корреляцию событий, исключение «шума» и ложных срабатываний
  • Управлять жизненным циклом инцидентов: регистрация, приоритизация, координация команд, разбор причин (post‑mortem), фиксация выводов и мер по предотвращению повторов
  • Формировать регулярную отчётность по работе службы: статистика инцидентов (количество, длительность, влияние), тренды по доступности сервисов, эффективность реагирования, динамика SLA, предложения по улучшению
  • Оптимизировать процессы эксплуатации: автоматизировать типовые действия дежурных, внедрять runbooks и playbooks, снижать ручные операции, повышать наблюдаемость систем
  • Обеспечивать взаимодействие со смежными подразделениями (разработка, DevOps, SRE, ИБ, поддержка): регламенты взаимодействия, совместные учения, разбор сложных инцидентов
  • Участвовать в планировании и внедрении изменений, влияющих на доступность: релизы, миграции, масштабирование; согласовывать окна работ и контрольные точки мониторинга
  • Развивать команду: обучение дежурных, наставничество, оценка компетенций, формирование базы знаний и инструкций
  • Вести документацию отдела: регламенты, инструкции, матрицы ответственности, журналы изменений, отчёты и результаты аудитов процессов

Требования

  • Опыт руководящей работы в эксплуатации, мониторинге или дежурной службе от 3 лет; опыт управления командой дежурных инженеров
  • Практический опыт построения процессов 24×7, включая графики, эскалации, SLA/SLO, post‑mortem‑разборы
  • Глубокое понимание принципов мониторинга и наблюдаемости: метрики, логи, трейсы, корреляция событий, снижение шума алертов
  • Знание инструментов мониторинга и алертинга (Prometheus, Grafana, Zabbix, Nagios, ELK/Loki и аналоги), опыт настройки дашбордов и алертов под бизнес‑требования
  • Понимание жизненного цикла инцидента, умение формализовать процессы и измерять эффективность службы (MTTR, MTBF, процент инцидентов в SLA)
  • Опыт формирования отчётности и визуализации метрик для технических и бизнес‑аудиторий
  • Базовое понимание инфраструктуры и сервисов: Linux, сети, контейнеризация, CI/CD, принципы отказоустойчивости и высокой доступности
  • Навыки автоматизации и работы с инструментами (Bash, Python, скрипты для интеграции с системами уведомлений и тикетами)
  • Умение выстраивать процессы и регламенты, договариваться со смежными командами, отстаивать приоритеты и обосновывать инвестиции в инструменты и процессы
  • Готовность к участию в дежурствах и оперативному реагированию на критические инциденты при необходимости

Что предлагаем

  • Конкурентную заработную плату — уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
  • ДМС — заботимся о здоровье сотрудников и предоставляем расширенные программы
  • Обучение и развитие — доступ к курсам, профессиональным программам и внутреннему обучению
  • Карьерный рост — возможности развиваться в своей специализации и переходить на новые направления
  • Интересные IT-задачи — участие в проектах, которые напрямую влияют на развитие крупного бизнеса
  • Современный стек и технологии — возможность работать с актуальными инструментами и подходами
  • Гибкий формат работы — обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
  • Сильная команда — работа с опытными специалистами из IT и смежных бизнес-направлений
  • Стабильность — крупная компания с масштабными проектами и долгосрочными планами развития
  • Корпоративные бонусы — скидки на продукцию компании и дополнительные программы для сотрудников
  • Комфортные условия работы — современная рабочая среда, необходимые инструменты и всё для эффективной работы
Посмотреть контакты работодателя

Похожие вакансии

Ведущий специалист мониторинга и дежурной службы эксплуатации

Крупная российская компания с развитым бизнесом и собственными IT-решениями

  • Москва

  • Не указана

Рекомендуем
Солар
  • Москва

  • Не указана

Рекомендуем

Руководитель управления платформенной инженерии

Крупная российская компания с развитым бизнесом и собственными IT-решениями

  • Москва

  • Не указана

Рекомендуем
РУСАЛ
  • Москва

  • Не указана

Группа страховых компаний Югория
  • Москва

  • Не указана

Хайтес Коммьюникейшнс
  • Москва

  • Не указана

Инфотек
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию