Оперативное реагирование на инциденты — совместная работа с командой мониторинга, быстрое определение зоны ответственности (приложение / инфраструктура / сеть / внешний сервис)
Оценка влияния — определение воздействия на затронутые системы и бизнес-процессы клиентов
Руководство процессом устранения — координация работы инженеров и смежных команд, контроль эскалаций и статусов без глубокого погружения в код/конфиг
Ведение хронологии инцидента — фиксация всех событий, действий и решений в реальном времени
Информирование стейкхолдеров — оперативное и структурированное оповещение руководства и затронутых сторон
Отчётность по итогам — подготовка отчётов об инцидентах, участие в постмортемах (RCA), контроль корректирующих действий
Разработка документации — составление инструкций и регламентов для коллег
Что мы ждем от кандидата:
Опыт работы: от 3 лет в IT (предпочтительно в инцидент-менеджменте)
ITIL/ITSM: знание процессов Incident, Problem, Change Management
Мониторинг и визуализация: опыт работы с Zabbix, Prometheus, Grafana, ELK/OpenSearch — умение читать дашборды, находить аномалии, определять зону ответственности
Сети и инфраструктура: понимание TCP/IP, DNS, балансировщиков, основных протоколов
Виртуализация: опыт работы с VMware, OpenStack или облачными провайдерами
Язык: английский — чтение технической документации
График: готовность к сменной работе (2/2, дневные и ночные смены, выходные), работа из офиса
Коммуникация: грамотная устная и письменная речь, умение чётко и структурированно доносить информацию