О проекте:
Мы — технологический стрим. Внутри стрима мы формируем новую автономную команду сопровождения в часовом поясе МСК+5. Задача команды — обеспечивать непрерывную работу, мониторинг и оперативное устранение инцидентов на промышленной среде во внерабочее для Москвы время. Мы ищем инженера поддержки «на месте»,который со временем вырастет в эксперта по надежности и траблшутингу.
Обязанности:
- Работа с инцидентами: контроль за своевременным реагированием на сбои (Incident Management) на проме, локализация проблем и восстановление работоспособности систем по SLA.
- Взаимодействие в рамках стрима: плотная синхронизация с московской командой сопровождения и смежными командами, в т.ч. при передаче новых релизов на поддержку.
- Мониторинг и контроль: развитие систем мониторинга, контроль за метриками здоровья приложений (Health checks, бизнес-метрики).
- Ведение базы знаний: актуализация эксплуатационной документации, инструкций по устранению аварий (Runbooks) и проведение Post-mortem анализа инцидентов.
Требования: - Знание ITIL/ITSM: понимание процессов Incident, Problem и Event Management.
- Техническая база.
- Уверенное администрирование Linux, умение оперативно ориентироваться в консоли и анализировать логи.
- Понимание принципов работы контейнеризации (Docker, Kubernetes) на уровне проверки статусов подов и чтения логов контейнеров.
- Базовые навыки работы с СУБД (PostgreSQL) — написание SQL-запросов для проверки данных при инцидентах.
- Понимание принципов мониторинга (Grafana, Prometheus, ELK) и сетевого взаимодействия (микросервисная архитектура).
- Soft Skills: высокая автономность (работа в отрыве от основного времени МСК), умение принимать решения в условиях критических аварий.
Будет плюсом:
- Опыт работы в банковском секторе (FinTech) или крупных Enterprise-компаниях со строгими SLA.