Руководитель отдела эксплуатации ИТ-инфраструктуры

Раппорто

Руководитель отдела эксплуатации ИТ-инфраструктуры

Москва, улица Малая Дмитровка, 20

Метро: Маяковская

Описание вакансии

Rapporto – одна из крупнейших IT-компаний на рынке телекоммуникаций. Более 17 лет мы обслуживаем B2B-рынок.

Наши продукты позволяют компаниям ежедневно общаться со своими клиентами через различные каналы коммуникаций: push-уведомления, мессенджеры, SMS-сообщения, IVR и другие.

Среди клиентов: ВкусВилл, ЦУМ, Лэтуаль, Боксберри, Л’Окситан, ОТП Банк, Райффайзенбанк и другие.

Нас 200 человек, у нас нет лишней бюрократии, работы ради галочки или микроменеджмента. Зато есть много сложных и интересных задач, быстрое принятие решений, а главное – у нас есть отличная команда!

Стек:
Обязательно:

Linux, Kubernetes, Docker/containers, TCP/IP, HTTP/TLS, DNS, балансировка нагрузки, Git, CI/CD, Infrastructure as Code, системы мониторинга и логирования.

Практический опыт с частью следующего стека:

Kubernetes, Helm;

GitLab CI/CD, ArgoCD;

Ansible, Terraform;

VMware/vCloud или аналогичные IaaS-платформы;

Nginx, HAProxy;

PostgreSQL;

Kafka;

Redis;

Prometheus/VictoriaMetrics, Grafana;

Loki/ELK, Tempo/Jaeger;

Vault / системы управления секретами;

Harbor или другие container registry;

Keycloak/SSO;

backup/restore solutions;

сетевое оборудование, VPN, firewall.

Обязанности:

  • Управление направлением эксплуатации и ИТ-инфраструктуры компании;
  • Обеспечение стабильной и отказоустойчивой работы production-систем и инфраструктурных сервисов;
  • правление командами эксплуатации, SRE и системного администрирования: постановка целей, приоритизация, развитие сотрудников, распределение ответственности;
  • Развитие Kubernetes-платформы, виртуальной и облачной инфраструктуры, сетевой инфраструктуры и инфраструктурных сервисов;
  • Организация эксплуатации систем в нескольких ЦОД и облачных площадках;
  • Развитие процессов мониторинга, observability, алертинга и дежурств.
  • Определение и контроль SLI/SLO/SLA для критичных сервисов;
  • Организация Incident Management, Problem Management, Change Management, проведение разборов крупных инцидентов и контроль выполнения корректирующих мероприятий;
  • Повышение отказоустойчивости систем, развитие резервирования, backup/restore и Disaster Recovery;
  • Развитие Infrastructure as Code и автоматизации эксплуатации;
  • Развитие CI/CD и GitOps-подходов совместно с командами разработки;
  • Управление производительностью и capacity planning инфраструктуры;
  • Контроль технического долга инфраструктуры, версий ПО и своевременного обновления компонентов;
  • Участие в архитектурных решениях по новым продуктам и сервисам;
  • Совместная работа с ИБ по управлению доступами, секретами, уязвимостями и защите инфраструктуры;
  • Управление подрядчиками, ЦОД, облачными и телеком-провайдерами;
  • Планирование и контроль бюджета инфраструктуры, оптимизация инфраструктурных затрат;
  • Формирование технической стратегии развития инфраструктуры и эксплуатационной модели;
  • Подготовка регулярной отчетности по доступности, инцидентам, производительности, емкости и инфраструктурным рискам;
  • Формирование и развитие сильной команды эксплуатации и ИТ-инфраструктуры;
  • Развитие технических и управленческих компетенций сотрудников, формирование индивидуальных планов развития;
  • Регулярная оценка эффективности сотрудников, проведение 1:1 и предоставление обратной связи.
  • Выстраивание понятных зон ответственности внутри команды, развитие ownership за сервисы и инфраструктурные компоненты;
  • Развитие технических лидеров внутри подразделения и формирование кадрового резерва;
  • Участие в найме, адаптации и удержании сотрудников;
  • Формирование требований к ролям и уровням специалистов, участие в развитии системы грейдов;
  • Выявление skill gaps команды и организация обучения, обмена знаниями и внутренних технических практик;
  • Снижение зависимости от отдельных ключевых специалистов через документацию, передачу знаний и распределение экспертизы;
  • Формирование инженерной культуры: автоматизация вместо ручных операций, ответственность за результат, postmortem без поиска виноватых, работа с техническим долгом;
  • Построение системы делегирования, при которой руководитель не становится единственной точкой принятия решений;
  • Формирование преемственности внутри команды для ключевых ролей.
Требования:
  • Опыт работы в эксплуатации высоконагруженных production-систем от 5–6 лет.
  • Опыт управления инженерной командой от 2–3 лет. Практический опыт эксплуатации Linux, Kubernetes, виртуальной и облачной инфраструктуры.
  • Опыт построения отказоустойчивых систем, мониторинга и observability, организации резервного копирования и Disaster Recovery.
  • Опыт управления крупными инцидентами и проведения postmortem.
  • Понимание принципов SRE, SLI/SLO/SLA, Incident/Problem/Change Management.
  • Опыт автоматизации инфраструктуры и применения Infrastructure as Code.
  • Опыт взаимодействия с разработкой, информационной безопасностью, технической поддержкой, внешними провайдерами и подрядчиками.
  • Желателен опыт эксплуатации высоконагруженных систем 24×7 и инфраструктуры, распределенной между несколькими ЦОД/облачными площадками.
Условия:
  • работу в аккредитованной IT-компании;
  • формат работы: удаленно на территории РФ по мск времени с 9.00 до 18.00 ч или 10.00 ч до 19.00 ч;
  • ДМС после трех месяцев работы, включая стоматологию и психолога;
  • дружную команду профессионалов: ценим юмор, проводим крутые корпоративы, организовываем мастер-классы, квизы и другие мероприятия для неформального общения с коллегами.
Посмотреть контакты работодателя

Адрес

Похожие вакансии

Miractal
  • Москва

  • Не указана

Рекомендуем
efin
  • Москва

  • Не указана

Рекомендуем
Фрейт Вилладж Девелопмент

Руководитель IT службы терминала

Фрейт Вилладж Девелопмент

  • Москва

  • Не указана

Рекомендуем
  • Москва

  • Не указана

КомСтрой
  • Москва

  • Не указана

  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию