Senior SRE

Finstar Financial Group

Senior SRE

Москва, Московский международный деловой центр Москва-Сити

Метро: Деловой центр

Описание вакансии

Мы создаём цифровой финансовый продукт, который меняет подход к кредитованию: карту без процентов и годового обслуживания, полностью управляемую через мобильное приложение. Продукт работает в трёх регионах, обслуживает около 300 000 пользователей и выдерживает нагрузку более 500 RPS.

Мы ищем Senior SRE, который возьмёт на себя ответственность за процессы Monitoring & Event Management и Availability & Capacity Management. В этой роли важно не просто реагировать на инциденты, а выстраивать системную надёжность: прогнозировать нагрузку, определять измеримые цели по доступности, развивать observability и превращать выводы из сбоев в устойчивые изменения.

Ключевые зоны ответственности

  • Availability & Capacity Management: доступность, производительность, прогнозирование нагрузки и достаточность ресурсов.
  • Monitoring & Event Management: качество мониторинга, событий, алертов и процессов реакции.
  • Observability: метрики, логи, трассировки, дашборды и диагностическая готовность систем.
  • Reliability governance: SLI/SLO, анализ инцидентов, disaster recovery и системные улучшения.

Чем предстоит заниматься

  • Сформировать SLI/SLO для критичных пользовательских сценариев совместно с бизнесом и техническими командами и внедрить контроль их соблюдения.
  • Развивать мониторинг на базе Grafana, Prometheus, Zabbix и CloudWatch; проектировать информативные дашборды, улучшать алерты и снижать шум событий.
  • Развивать централизованные логи в CloudWatch Logs и распределённую трассировку: расширять применение OpenTelemetry и оценивать использование AWS X-Ray.
  • Прогнозировать нагрузку и потребность в ресурсах, выявлять узкие места и формировать рекомендации по масштабированию.
  • Участвовать в нагрузочных испытаниях вместе с отдельным специалистом и использовать результаты для Capacity Management.
  • Подключаться к production-инцидентам как технический эксперт, при необходимости координировать восстановление и регулярно проводить RCA.
  • Обеспечивать выполнение корректирующих действий по итогам RCA и превращать выводы из инцидентов в устойчивые изменения систем и процессов.
  • Отвечать за disaster recovery: определять и согласовывать RTO/RPO, контролировать резервное копирование, проводить тесты восстановления и проверять сценарии отказа AWS-региона.
  • Контролировать доступность внешних систем, самостоятельно взаимодействовать с поддержкой поставщиков, координировать устранение сбоев и контролировать выполнение SLA.
  • Участвовать во внутренних аудитах, учитывать требования регуляторов и обеспечивать корректную работу с персональными данными.

Что для нас важно

  • Не менее трёх лет опыта в роли SRE, DevOps или Infrastructure Engineer и готовность работать на уровне Senior.
  • Практический опыт построения и развития процессов Monitoring & Event Management, Availability & Capacity Management и observability.
  • Опыт определения SLI/SLO и внедрения измеримых целей надёжности.
  • Уверенная работа с AWS, Kubernetes и Terraform в production-среде.
  • Практический опыт администрирования и настройки Grafana и Zabbix; понимание Prometheus и CloudWatch.
  • Понимание метрик, логов и распределённой трассировки, а также умение выстраивать диагностику сложных сбоев.
  • Глубокое понимание Linux, сетевых протоколов и принципов работы распределённых систем.
  • Опыт incident response, RCA и контроля выполнения корректирующих действий.
  • Способность создавать поддерживаемые инструменты автоматизации, скрипты и интеграции; конкретный язык программирования не принципиален.
  • Практическое владение инструментами, в том числе AI, для написания и ревью кода, анализа логов и инцидентов, подготовки RCA, runbook и работы с инфраструктурой — с обязательной проверкой результатов перед применением в production.
  • Свободный русский и английский не ниже B2: предстоит регулярно общаться с мексиканскими коллегами, партнёрами и вендорами.

Будет плюсом

  • Опыт эксплуатации multi-region инфраструктуры и подготовки сценариев регионального отказа.
  • Опыт мониторинга мобильных приложений и внешних финансовых интеграций.
  • Практический опыт внедрения OpenTelemetry или AWS X-Ray.
  • Опыт работы в финтехе и понимание требований PCI DSS.
  • Опыт взаимодействия с регуляторами и участия в технических аудитах.
Навыки
  • AWS
  • Grafana
  • Zabbix
  • Prometheus
  • Kubernetes
  • Linux
  • Terraform
Посмотреть контакты работодателя

Адрес

Похожие вакансии

CyberOK
  • Москва

  • Не указана

Рекомендуем
Азиатско-Тихоокеанский Банк

DevOps-инженер (Senior)

Азиатско-Тихоокеанский Банк

  • Москва

  • Не указана

Рекомендуем
Marfatech
  • Москва

  • Не указана

Рекомендуем
МФК Фордевинд

Старший DevOps-инженер

МФК Фордевинд

  • Москва

  • Не указана

Плати по всему миру

Senior DevOps Engineer

Плати по всему миру

  • Москва

  • Не указана

Senior DevOps

Казарьянц Артур Эдуардович

  • Москва

  • Не указана

QTECH
  • Москва

  • Не указана

Ventra
  • Москва

  • Не указана

Playerok
  • Москва

  • от 270000 RUR

Фалькон Тех

Senior DevOps инженер

Фалькон Тех

  • Москва

  • от 270000 RUR

Объединенное Кредитное Бюро

Senior DevOps инженер

Объединенное Кредитное Бюро

  • Москва

  • от 270000 RUR

Юрент

Team Lead DevOps

Юрент

  • Москва

  • от 270000 RUR

Клируэй Текнолоджис

SRE-инженер

Клируэй Текнолоджис

  • Москва

  • от 270000 RUR

Lamoda Tech

Ведущий SRE

Lamoda Tech

  • Москва

  • от 270000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию