Эксплуатацией распределенных систем хранения: обеспечение доступности данных на уровне (99.99%) в системах на базе MiniIO. Автоматизация процессов резервного копирования и восстановления данных, сокращение RTO. Disaster Recovery для stateful-приложений и инфраструктуры. Регулярное тестирование процедур аварийного восстановления;
Сетевой инфраструктурой и балансировкой:настройка и поддержка L4/L7 балансировщиков нагрузки (HAProxy, Keepalived). Управление сертификатами (HashiCorp Vault), службами DNS и DHCP;
Мониторингом и наблюдаемостью: участие в развитии многоуровневой системы наблюдаемости (метрики, логи, трейсы) на базе стека Prometheus: Victoria Metrics, Grafana, Tempo/Jaeger. Сопровождение системы мониторинга Zabbix до полного работы с метриками на стек Prometheus. Настройка экспортеров, разработка дашбордов и интеллектуального алертинга (сокращение MTTD/MTTR). Централизованное логирование (Splunk, Fluent Bit/Vector);
Управлением инцидентами: техническая организация полного цикла реагирования инцидентов, управление алертингом, глубокая диагностика на уровне сети, ОС;
Технической поддержкой: диагностика и устранение сбоев ОС, сетевых сервисов и прикладного ПО, администрирование учетных записей и разрешение инцидентов.
Что мы ожидаем:
Опыт: от 3-х лет на позиции старшего системного администратора с фокусом на надежность;
Linux: тюнинг производительности, отладка, управление systemd, cgroups, namespaces, работа с файловыми системами (LVM, ext4, xfs). Умение диагностировать проблемы CPU, памяти, дискового ввода-вывода и сети;
Виртуализация: работа с гипервизором VMware vSphere. Управление жизненным циклом ВМ;