Позиция для технически сильного руководителя, готового не просто поддерживать мониторинг, а выстраивать observability для сложной инфраструктуры: разбираться в архитектуре новых систем, определять точки контроля и метрики, и превращать это в решения силами команды.
Управление платформами мониторинга, развитие дашбордов для NOC и руководства, влияние на скорость обнаружения и решения инфраструктурных проблем в масштабе крупного финансового холдинга.
Задачи:
- Управление командой администраторов платформ мониторинга, распределение задач и контроль их выполнения;
- Эксплуатация и развитие платформ Zabbix, Grafana и Dynatrace, обеспечение их стабильной работы и доступности;
- Организация постановки новых ИС, инфраструктурных объектов, платформ и клиентских сервисов на мониторинг;
- Самостоятельная проработка технического подхода к мониторингу: анализ архитектуры и зависимостей, определение точек контроля, способов сбора данных (Agent, SNMP, API, APM, логи и др.), обязательных метрик, порогов и алертов;
- Развитие мониторинга ИТ-инфраструктуры, платформ и клиентских сервисов с точки зрения доступности, производительности и деградации;
- Построение и развитие дашбордов для NOC, технических команд, владельцев систем и руководства;
- Контроль качества и полноты мониторинга, корректности алертов, снижение ложных срабатываний и технического шума;
- Участие в анализе инцидентов и технических проблем с использованием данных мониторинга, локализация проблемного компонента и причин деградации;
- Взаимодействие с командами инфраструктуры, разработки, сопровождения, владельцами систем и вендорами по вопросам мониторинга и observability;
- Стандартизация и автоматизация процессов постановки систем на мониторинг, развитие единых подходов и требований.
Мы ожидаем от кандидата:
- Высшее образование — техническое или финансово-экономическое;
- Опыт администрирования, внедрения и развития систем мониторинга корпоративного уровня. Практический опыт работы с Zabbix, Grafana, Dynatrace либо сопоставимыми решениями;
- Умение самостоятельно организовать постановку новой ИС, платформы или инфраструктурного объекта на мониторинг: разобраться в архитектуре и зависимостях, определить точки контроля, выбрать способ мониторинга (Agent, SNMP, API, JMX, логи, Synthetic, APM/RUM и др.), определить необходимый набор метрик, порогов и алертов;
- Понимание принципов мониторинга ИТ-инфраструктуры, платформ и клиентских сервисов: серверы и ОС, СУБД, сетевое оборудование, системы хранения, виртуализация, Kubernetes, middleware, приложения, API и пользовательские сервисы;
- Практическое понимание APM и observability: метрики, логи, трассировки, сервисы и их зависимости, response time, error/failure rate, throughput, пользовательские действия и бизнес-критичные операции;
- Умение строить мониторинг доступности, производительности и деградации сервисов, определять пороговые значения и условия алертинга;
- Навыки анализа и диагностики инцидентов на основании данных мониторинга;
- Хорошее понимание Linux/Windows, TCP/IP, HTTP/HTTPS, DNS, SNMP, REST API, принципов работы виртуализации и Kubernetes;
- Опыт построения дашбордов для NOC, технических команд, владельцев систем и руководства;
- Опыт управления технической командой: постановка и контроль задач, развитие сотрудников, стандартизация подходов и контроль качества настроек мониторинга;
- Знание английского язык на уровне, достаточном для чтения и понимания технической документации.
Что мы предлагаем:
- Работу в профессиональном коллективе и возможности неограниченного роста;
- Скидки на фитнес и обучение английскому языку, подарки на праздники и дни рождения;
- Бонусы и уникальные предложения от компаний холдинга;
- Спонсирование профессионального обучения;
- Насыщенную корпоративную жизнь: выезды на природу, праздничные мероприятия, игры и розыгрыши подарков.