анализ инцидентов: работа с обращениями пользователей, выявление дефектов, регистрация и контроль за устранением, оценка масштаба влияния, ремонт данных;
проведение RCA (Root Cause Analysis): выявление первоисточника проблемы и его исправление;
работа с логами: настройка логирования, анализ системных журналов для поиска причин ошибок и работы системы, выявление точек сбоя и угроз для работы системы;
мониторинг: определять новые критичные сервисы и точки контроля, выводить их на мониторинг, корректировать текущие показатели здоровья системы и сервисов и правил реагирования. Проводить анализ по сработавшим метрикам, определять причину, критичность, устранять проблему и последствия.
Требования:
высшее образование;
понимание принципа работы микросервисной архитектуры и контейнеризации (OpenShift/k8s/Kubernetes);
знание средств мониторинга и сбора логов Kibana, Grafana, Zabbix;
опыт проведения работ по внедрению поставок на тестовые контура, прод в части исправления дефектов, новой функциональности, интеграционных релизов;
уверенное знание SQL (желательно PostgreSQL);
умение самостоятельно принимать технические решения в рамках своей зоны ответственности;
умение быстро локализовывать причину инцидента;
грамотная коммуникация с разработчиками, DevOps, DBA, инфраструктурными и смежными командами;