Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.
Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.
Ищем руководителя, который выстроит и возглавит работу круглосуточной дежурной службы и системы мониторинга. Ваша ключевая цель — обеспечить стабильную работу сервисов за счёт своевременного выявления инцидентов, чёткой организации дежурств, прозрачных процессов реагирования и регулярной отчётности. Вы будете отвечать не только за оперативное устранение сбоев, но и за развитие процессов, снижение количества и длительности инцидентов, а также за повышение зрелости службы мониторинга.
Задачи
- Организовать и руководить работой дежурной службы 24×7: графики дежурств, ротация, эскалации, передача смен, контроль исполнения регламентов
- Выстроить процессы мониторинга и реагирования на инциденты: SLA по времени обнаружения и устранения, матрицы эскалации, чек‑листы действий дежурных, сценарии автоуведомлений
- Настроить и поддерживать систему мониторинга: ключевые метрики (uptime, latency, ошибки, нагрузка), алерты, дашборды, корреляцию событий, исключение «шума» и ложных срабатываний
- Управлять жизненным циклом инцидентов: регистрация, приоритизация, координация команд, разбор причин (post‑mortem), фиксация выводов и мер по предотвращению повторов
- Формировать регулярную отчётность по работе службы: статистика инцидентов (количество, длительность, влияние), тренды по доступности сервисов, эффективность реагирования, динамика SLA, предложения по улучшению
- Оптимизировать процессы эксплуатации: автоматизировать типовые действия дежурных, внедрять runbooks и playbooks, снижать ручные операции, повышать наблюдаемость систем
- Обеспечивать взаимодействие со смежными подразделениями (разработка, DevOps, SRE, ИБ, поддержка): регламенты взаимодействия, совместные учения, разбор сложных инцидентов
- Участвовать в планировании и внедрении изменений, влияющих на доступность: релизы, миграции, масштабирование; согласовывать окна работ и контрольные точки мониторинга
- Развивать команду: обучение дежурных, наставничество, оценка компетенций, формирование базы знаний и инструкций
- Вести документацию отдела: регламенты, инструкции, матрицы ответственности, журналы изменений, отчёты и результаты аудитов процессов
Требования
- Опыт руководящей работы в эксплуатации, мониторинге или дежурной службе от 3 лет; опыт управления командой дежурных инженеров
- Практический опыт построения процессов 24×7, включая графики, эскалации, SLA/SLO, post‑mortem‑разборы
- Глубокое понимание принципов мониторинга и наблюдаемости: метрики, логи, трейсы, корреляция событий, снижение шума алертов
- Знание инструментов мониторинга и алертинга (Prometheus, Grafana, Zabbix, Nagios, ELK/Loki и аналоги), опыт настройки дашбордов и алертов под бизнес‑требования
- Понимание жизненного цикла инцидента, умение формализовать процессы и измерять эффективность службы (MTTR, MTBF, процент инцидентов в SLA)
- Опыт формирования отчётности и визуализации метрик для технических и бизнес‑аудиторий
- Базовое понимание инфраструктуры и сервисов: Linux, сети, контейнеризация, CI/CD, принципы отказоустойчивости и высокой доступности
- Навыки автоматизации и работы с инструментами (Bash, Python, скрипты для интеграции с системами уведомлений и тикетами)
- Умение выстраивать процессы и регламенты, договариваться со смежными командами, отстаивать приоритеты и обосновывать инвестиции в инструменты и процессы
- Готовность к участию в дежурствах и оперативному реагированию на критические инциденты при необходимости
Что предлагаем
- Конкурентную заработную плату — уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
- ДМС — заботимся о здоровье сотрудников и предоставляем расширенные программы
- Обучение и развитие — доступ к курсам, профессиональным программам и внутреннему обучению
- Карьерный рост — возможности развиваться в своей специализации и переходить на новые направления
- Интересные IT-задачи — участие в проектах, которые напрямую влияют на развитие крупного бизнеса
- Современный стек и технологии — возможность работать с актуальными инструментами и подходами
- Гибкий формат работы — обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
- Сильная команда — работа с опытными специалистами из IT и смежных бизнес-направлений
- Стабильность — крупная компания с масштабными проектами и долгосрочными планами развития
- Корпоративные бонусы — скидки на продукцию компании и дополнительные программы для сотрудников
- Комфортные условия работы — современная рабочая среда, необходимые инструменты и всё для эффективной работы