Москва, улица Обручева, 30/1с2
Метро: ВоронцовскаяСбер2В — система бизнес-сервисов под единым управлением. Вместе мы решаем комплексные задачи государства, бизнеса и регионов с помощью аналитики больших данных, искусственного интеллекта, автоматизации и ЭДО.
Мы в цифрах:
• 50+ собственных решений
• 1,2 млн клиентов малого бизнеса
• 40+ отраслей используют наши продукты
• 2,5 тыс. клиентов крупного бизнеса и госсектора
Наши технологии (аналитика больших данных, машинное обучения, визуализация) помогают бизнесу расти, а регионам — развиваться.
Мы находимся в процессе активной централизации ИТ-компаний в единую группу и строим объединенное направление SRE
Мы ищем руководителя направления, который будет управлять этой функцией и одновременно оставаться глубоко в технике. Роль "играющего тренера", способного лично вести сложные инциденты и принимать архитектурные решения.
Чем предстоит заниматься:
Управлять направлением SRE: несколько групп инженеров, найм, распределение задач и сервисов, развитие руководителей групп, бюджетирование;
Разрабатывать и внедрять стандарты SRE на уровне всего управления: мониторинг, инструкции реагирования, разбор инцидентов, SLO. Следить за соблюдением стандартов в продуктовых командах и дочерних обществах;
Проектировать архитектуру надежности: отказоустойчивость, multi-AZ, деградация, плавное завершение, ограничители нагрузки;
Лично координировать самые сложные инциденты P0: созывать боевые комнаты, управлять несколькими командами, принимать решения по деградации, откату и переключению на резерв;
Проводить разборы инцидентов P0: формировать отчеты, программы мероприятий и контролировать их исполнение;
Анализировать первопричины системных проблем на уровне управления и разрабатывать программы их устранения;
Участвовать в совете по изменениям, оценивать риски стратегических изменений и авторизовывать их вывод в промышленную среду;
Сопровождать стратегически важные релизы и миграции: контролировать планы развертывания, оценивать риски, обеспечивать готовность к откату;
Разрабатывать программы хаос-инжиниринга и тестирования аварийного восстановления, контролировать их проведение и анализировать результаты;
Согласовывать стандарты SRE с руководителями дочерних обществ и координировать общие практики.
Ты идеальный кандидат, если есть:
Опыт работы в ИТ - от 10 лет;
Опыт в SRE и эксплуатации от 6 лет, в том числе в роли руководителя группы SRE или эквивалентной;
Опыт ведения инцидентов P0 как координатора полного цикла;
Опыт разработки и внедрения стандартов и практик SRE на уровне подразделения, а не только одной команды;
Опыт управления группой или направлением, развития руководителей групп;
Глубокое понимание Linux и Windows Server на уровне диагностики ядра и производительности;
Понимание архитектуры контейнеризации и оркестрации (Docker, Kubernetes, OpenShift): кластеры, операторы, мультикластер;
Опыт проектирования систем мониторинга и наблюдаемости (Prometheus, Grafana, ELK/Loki, OpenTelemetry) на уровне стандартов;
Понимание сетей на уровне архитектуры: TCP/IP, DNS, HTTP/HTTPS, балансировка, сервис-меш, mTLS;
Опыт проектирования CI/CD-конвейеров и интеграции с эксплуатацией, работа с GitOps;
Владение Infrastructure as Code (Terraform, ArgoCD, Helm) на уровне проектирования и стандартов;
Опыт автоматизации задач с помощью Bash, Python или Go;
Понимание архитектуры реляционных и нереляционных баз данных: репликация, шардирование, отказоустойчивость, аварийное восстановление;
Понимание архитектуры надежности и распределенных систем: консенсус, кворумы, CAP, PACELC, согласованность, распределенные транзакции;
Готовность сочетать управленческую работу с технической экспертизой и личным участием в стратегических инцидентах и архитектурных решениях.
Будет плюсом, если:
Есть опыт работы в холдинговой структуре с несколькими дочерними обществами;
Есть опыт внедрения практики SLO и бюджетов ошибок на уровне ИТ-подразделения;
Есть опыт запуска программы хаос-инжиниринга и тестирования аварийного восстановления;
Есть опыт координации стратегических миграций: ЦОД, кластеры, облачные провайдеры;
Есть опыт наставничества руководителей групп с их карьерными переходами.
Что мы предлагаем:
Почему у нас классно работать:
Мы верим в силу данных как инструмента позитивных изменений.
Москва
Не указана
Страховая Компания РСХБ-Страхование
Москва
Не указана
Группа компаний Астра
Москва
Не указана
Москва
Не указана
Красное & Белое, розничная сеть
Москва
Не указана
Цифровые Пространственные Технологии
Москва
Не указана