Мы ищем SRE-инженера в команду сопровождения Платформы. Вы будете отвечать за стабильность, отказоустойчивость и бесперебойную работу высоконагруженных интеграционных систем.
Вам предстоит обеспечивать приемку новых версий продуктов на эксплуатационные контуры, а также выступать в роли эксперта 2-й линии технической поддержки для решения сложных инцидентов.
Твои задачи:
- сопровождение и эксплуатация высоконагруженных систем с применением методологий Site Reliability Engineering (SRE)
- участие в тестировании, приемке и внедрению в промышленную эксплуатацию релизов и доработок от команд разработки
- обеспечение бесперебойности сервиса: проектирование метрик уровня обслуживания, управление мониторингом, алертингом, эскалацией и решением инцидентов согласно методологиям Банка
- поддержание работоспособности сопровождаемых систем, участие в их восстановлении в случае сбоев, расследование корневых причин и разработка планов предотвращения повторения инцидентов
- участие во внедрении и аудите отказоустойчивых решений, проверка реализации паттернов высокой доступности (Rate Limiting, ByPass и т.д.)
- взаимодействие со смежными командами в рамках процессов тестирования, приемки, внедрений и устранения инцидентов.
Мы ожидаем, что у тебя есть:
- уверенное владение ОС Linux на уровне администратора
- навыки автоматизации рутинных задач на скриптовых языках (Bash, Python)
- опыт диагностики комплексных проблем в распределенных системах, поиска корневых причин
- понимание современных сетевых технологий: TCP/IP (IPv4/IPv6), DNS, DHCP, TLS/mTLS, Ingress-контроллеры, service mesh
- CI/CD: сопровождение пайплайнов доставки (GitLab CI, Jenkins, GitHub Actions) с точки зрения инфраструктуры
- глубокое знание контейнеризации и оркестрации: Docker, Kubernetes (Helm, Operators)
- опыт создания AI-агентов и использования их в работе будет преимуществом.
Будет плюсом:
- опыт применения методик SRE: понимание концепций Service Level Indicators (SLIs), Objectives (SLOs) и Error Budget.
- опыт эксплуатация АИ-Агентов: контроль потребления ресурсов, аудит логов принятия решений ИИ-моделей, мониторинг качества их работы (Model Drift)
- опыт Infrastructure as Code (IaC): уверенная работа с Terraform и Ansible.
- навыки настройки и организации мониторинга: Prometheus, Grafana, ELK Stack (Elasticsearch, Logstash, Kibana) или EFK
- знание языка запросов SQL, понимание принципов работы реляционных СУБД (PostgreSQL/Postgres Pro) и NoSQL-хранилищ.
Работа в Сбере - это:
- гибридный формат работы, после испытательного срока 4 дня в офисе/1 день удаленно) на период испытательного срока - офис.
- офис располагается по адресу : Москва, ул. 2-я Южнопортовая, 12Ак1с1
- годовой бонус и ежегодный пересмотр зарплаты
- расширенный ДМС с первого дня и льготное страхование для семьи
- корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях
- 90 дней удаленной работы из любого региона РФ
- льготная ипотека в Сбере
- подписка Прайм с возможностью совместного использования на трёх близких.