Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.
Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.
Ищем ведущего специалиста, который станет одной из опор круглосуточной дежурной службы: будет не просто реагировать на алерты, а глубоко разбираться в инцидентах, помогать команде стабилизировать сервисы и участвовать в развитии процессов мониторинга. Вы будете работать на стыке эксплуатации и инженерии: диагностировать проблемы в реальном времени, координировать смежные команды, снижать количество ложных срабатываний и улучшать наблюдаемость систем. Роль предполагает самостоятельность в принятии решений в рамках регламентов, наставничество для дежурных инженеров и участие в проработке архитектурных улучшений.
Задачи
- Оперативно реагировать на инциденты в рамках SLA: принимать алерты, проводить первичную диагностику, запускать процессы эскалации, координировать вовлечённые команды, контролировать закрытие инцидента.
- Проводить глубокий разбор инцидентов: выявлять корневые причины, фиксировать шаги решения, формировать короткие отчёты для команды и предложения по предотвращению повторов.
- Настраивать и поддерживать мониторинг: актуализировать алерты и пороги срабатывания, снижать «шум», добавлять новые метрики для проактивного выявления рисков, участвовать в создании дашбордов.
- Развивать наблюдаемость: помогать внедрять логирование, трейсинг и структурированные алерты там, где это критично для скорости диагностики.
- Автоматизировать типовые действия дежурных: писать скрипты (Bash, Python), настраивать интеграции с тикет‑системами и мессенджерами, создавать и актуализировать runbooks/playbooks.
- Консультировать и обучать дежурных инженеров: разбирать сложные кейсы, помогать осваивать инструменты и регламенты, участвовать в передаче смен и разборе дежурств.
- Участвовать в планировании изменений, влияющих на доступность: согласовывать окна работ, контрольные точки мониторинга, сценарии отката при проблемах.
- Формировать оперативную отчётность: сводки по инцидентам за смену/неделю, статистику по MTTR, доле инцидентов в SLA, количеству ложных алертов, динамике нагрузки.
- Взаимодействовать со смежными командами (DevOps, SRE, разработка, ИБ): фиксировать требования к наблюдаемости, согласовывать процедуры реагирования, участвовать в совместных учениях.
- Вести и актуализировать документацию: регламенты дежурств, матрицы ответственности, инструкции по типовым инцидентам, базу знаний.
Требования
- Опыт работы в эксплуатации, дежурной службе или мониторинге от 3 лет, понимание процессов 24×7 и регламентов реагирования.
- Уверенное владение инструментами мониторинга и алертинга (Prometheus, Grafana, Zabbix, Nagios, ELK/Loki и аналоги) и умение настраивать алерты под реальные бизнес‑риски.
- Практические навыки диагностики в Linux‑среде: анализ логов, метрик, сетевых проблем, работы контейнеров и сервисов.
- Понимание жизненного цикла инцидента и базовых метрик эффективности (MTTR, MTBF, SLA/SLO, доля инцидентов в SLA).
- Базовые навыки автоматизации: Bash, Python (или другой скриптовый язык) для типовых задач дежурного.
- Знание сетевых основ (TCP/IP, DNS, HTTP, TLS) и принципов работы высокодоступных и распределённых систем.
- Умение чётко и быстро фиксировать информацию, писать понятные отчёты и инструкции для команды.
- Хорошие коммуникативные навыки: способность спокойно и структурированно взаимодействовать с разработчиками, инженерами и менеджерами в стрессовых ситуациях.
- Готовность к дежурствам и оперативному включению в инциденты, в том числе в нерабочее время.
Что предлагаем
- Конкурентную заработную плату — уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
- ДМС — заботимся о здоровье сотрудников и предоставляем расширенные программы
- Обучение и развитие — доступ к курсам, профессиональным программам и внутреннему обучению
- Карьерный рост — возможности развиваться в своей специализации и переходить на новые направления
- Интересные IT-задачи — участие в проектах, которые напрямую влияют на развитие крупного бизнеса
- Современный стек и технологии — возможность работать с актуальными инструментами и подходами
- Гибкий формат работы — обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
- Сильная команда — работа с опытными специалистами из IT и смежных бизнес-направлений
- Стабильность — крупная компания с масштабными проектами и долгосрочными планами развития
- Корпоративные бонусы — скидки на продукцию компании и дополнительные программы для сотрудников
- Комфортные условия работы — современная рабочая среда, необходимые инструменты и всё для эффективной работы