Мы создаём цифровой финансовый продукт, который меняет подход к кредитованию: карту без процентов и годового обслуживания, полностью управляемую через мобильное приложение. Продукт работает в трёх регионах, обслуживает около 300 000 пользователей и выдерживает нагрузку более 500 RPS.
Мы ищем Senior SRE, который возьмёт на себя ответственность за процессы Monitoring & Event Management и Availability & Capacity Management. В этой роли важно не просто реагировать на инциденты, а выстраивать системную надёжность: прогнозировать нагрузку, определять измеримые цели по доступности, развивать observability и превращать выводы из сбоев в устойчивые изменения.
Ключевые зоны ответственности
- Availability & Capacity Management: доступность, производительность, прогнозирование нагрузки и достаточность ресурсов.
- Monitoring & Event Management: качество мониторинга, событий, алертов и процессов реакции.
- Observability: метрики, логи, трассировки, дашборды и диагностическая готовность систем.
- Reliability governance: SLI/SLO, анализ инцидентов, disaster recovery и системные улучшения.
Чем предстоит заниматься
- Сформировать SLI/SLO для критичных пользовательских сценариев совместно с бизнесом и техническими командами и внедрить контроль их соблюдения.
- Развивать мониторинг на базе Grafana, Prometheus, Zabbix и CloudWatch; проектировать информативные дашборды, улучшать алерты и снижать шум событий.
- Развивать централизованные логи в CloudWatch Logs и распределённую трассировку: расширять применение OpenTelemetry и оценивать использование AWS X-Ray.
- Прогнозировать нагрузку и потребность в ресурсах, выявлять узкие места и формировать рекомендации по масштабированию.
- Участвовать в нагрузочных испытаниях вместе с отдельным специалистом и использовать результаты для Capacity Management.
- Подключаться к production-инцидентам как технический эксперт, при необходимости координировать восстановление и регулярно проводить RCA.
- Обеспечивать выполнение корректирующих действий по итогам RCA и превращать выводы из инцидентов в устойчивые изменения систем и процессов.
- Отвечать за disaster recovery: определять и согласовывать RTO/RPO, контролировать резервное копирование, проводить тесты восстановления и проверять сценарии отказа AWS-региона.
- Контролировать доступность внешних систем, самостоятельно взаимодействовать с поддержкой поставщиков, координировать устранение сбоев и контролировать выполнение SLA.
- Участвовать во внутренних аудитах, учитывать требования регуляторов и обеспечивать корректную работу с персональными данными.
Что для нас важно
- Не менее трёх лет опыта в роли SRE, DevOps или Infrastructure Engineer и готовность работать на уровне Senior.
- Практический опыт построения и развития процессов Monitoring & Event Management, Availability & Capacity Management и observability.
- Опыт определения SLI/SLO и внедрения измеримых целей надёжности.
- Уверенная работа с AWS, Kubernetes и Terraform в production-среде.
- Практический опыт администрирования и настройки Grafana и Zabbix; понимание Prometheus и CloudWatch.
- Понимание метрик, логов и распределённой трассировки, а также умение выстраивать диагностику сложных сбоев.
- Глубокое понимание Linux, сетевых протоколов и принципов работы распределённых систем.
- Опыт incident response, RCA и контроля выполнения корректирующих действий.
- Способность создавать поддерживаемые инструменты автоматизации, скрипты и интеграции; конкретный язык программирования не принципиален.
- Практическое владение инструментами, в том числе AI, для написания и ревью кода, анализа логов и инцидентов, подготовки RCA, runbook и работы с инфраструктурой — с обязательной проверкой результатов перед применением в production.
- Свободный русский и английский не ниже B2: предстоит регулярно общаться с мексиканскими коллегами, партнёрами и вендорами.
Будет плюсом
- Опыт эксплуатации multi-region инфраструктуры и подготовки сценариев регионального отказа.
- Опыт мониторинга мобильных приложений и внешних финансовых интеграций.
- Практический опыт внедрения OpenTelemetry или AWS X-Ray.
- Опыт работы в финтехе и понимание требований PCI DSS.
- Опыт взаимодействия с регуляторами и участия в технических аудитах.