Rapporto – одна из крупнейших IT-компаний на рынке телекоммуникаций. Более 17 лет мы обслуживаем B2B-рынок.
Наши продукты позволяют компаниям ежедневно общаться со своими клиентами через различные каналы коммуникаций: push-уведомления, мессенджеры, SMS-сообщения, IVR и другие.
Среди клиентов: ВкусВилл, ЦУМ, Лэтуаль, Боксберри, Л’Окситан, ОТП Банк, Райффайзенбанк и другие.
Нас 200 человек, у нас нет лишней бюрократии, работы ради галочки или микроменеджмента. Зато есть много сложных и интересных задач, быстрое принятие решений, а главное – у нас есть отличная команда!
Стек:
Обязательно:
Linux, Kubernetes, Docker/containers, TCP/IP, HTTP/TLS, DNS, балансировка нагрузки, Git, CI/CD, Infrastructure as Code, системы мониторинга и логирования.
Практический опыт с частью следующего стека:
Kubernetes, Helm;
GitLab CI/CD, ArgoCD;
Ansible, Terraform;
VMware/vCloud или аналогичные IaaS-платформы;
Nginx, HAProxy;
PostgreSQL;
Kafka;
Redis;
Prometheus/VictoriaMetrics, Grafana;
Loki/ELK, Tempo/Jaeger;
Vault / системы управления секретами;
Harbor или другие container registry;
Keycloak/SSO;
backup/restore solutions;
сетевое оборудование, VPN, firewall.
Обязанности:
- Управление направлением эксплуатации и ИТ-инфраструктуры компании;
- Обеспечение стабильной и отказоустойчивой работы production-систем и инфраструктурных сервисов;
- правление командами эксплуатации, SRE и системного администрирования: постановка целей, приоритизация, развитие сотрудников, распределение ответственности;
- Развитие Kubernetes-платформы, виртуальной и облачной инфраструктуры, сетевой инфраструктуры и инфраструктурных сервисов;
- Организация эксплуатации систем в нескольких ЦОД и облачных площадках;
- Развитие процессов мониторинга, observability, алертинга и дежурств.
- Определение и контроль SLI/SLO/SLA для критичных сервисов;
- Организация Incident Management, Problem Management, Change Management, проведение разборов крупных инцидентов и контроль выполнения корректирующих мероприятий;
- Повышение отказоустойчивости систем, развитие резервирования, backup/restore и Disaster Recovery;
- Развитие Infrastructure as Code и автоматизации эксплуатации;
- Развитие CI/CD и GitOps-подходов совместно с командами разработки;
- Управление производительностью и capacity planning инфраструктуры;
- Контроль технического долга инфраструктуры, версий ПО и своевременного обновления компонентов;
- Участие в архитектурных решениях по новым продуктам и сервисам;
- Совместная работа с ИБ по управлению доступами, секретами, уязвимостями и защите инфраструктуры;
- Управление подрядчиками, ЦОД, облачными и телеком-провайдерами;
- Планирование и контроль бюджета инфраструктуры, оптимизация инфраструктурных затрат;
- Формирование технической стратегии развития инфраструктуры и эксплуатационной модели;
- Подготовка регулярной отчетности по доступности, инцидентам, производительности, емкости и инфраструктурным рискам;
- Формирование и развитие сильной команды эксплуатации и ИТ-инфраструктуры;
- Развитие технических и управленческих компетенций сотрудников, формирование индивидуальных планов развития;
- Регулярная оценка эффективности сотрудников, проведение 1:1 и предоставление обратной связи.
- Выстраивание понятных зон ответственности внутри команды, развитие ownership за сервисы и инфраструктурные компоненты;
- Развитие технических лидеров внутри подразделения и формирование кадрового резерва;
- Участие в найме, адаптации и удержании сотрудников;
- Формирование требований к ролям и уровням специалистов, участие в развитии системы грейдов;
- Выявление skill gaps команды и организация обучения, обмена знаниями и внутренних технических практик;
- Снижение зависимости от отдельных ключевых специалистов через документацию, передачу знаний и распределение экспертизы;
- Формирование инженерной культуры: автоматизация вместо ручных операций, ответственность за результат, postmortem без поиска виноватых, работа с техническим долгом;
- Построение системы делегирования, при которой руководитель не становится единственной точкой принятия решений;
- Формирование преемственности внутри команды для ключевых ролей.
Требования: - Опыт работы в эксплуатации высоконагруженных production-систем от 5–6 лет.
- Опыт управления инженерной командой от 2–3 лет. Практический опыт эксплуатации Linux, Kubernetes, виртуальной и облачной инфраструктуры.
- Опыт построения отказоустойчивых систем, мониторинга и observability, организации резервного копирования и Disaster Recovery.
- Опыт управления крупными инцидентами и проведения postmortem.
- Понимание принципов SRE, SLI/SLO/SLA, Incident/Problem/Change Management.
- Опыт автоматизации инфраструктуры и применения Infrastructure as Code.
- Опыт взаимодействия с разработкой, информационной безопасностью, технической поддержкой, внешними провайдерами и подрядчиками.
- Желателен опыт эксплуатации высоконагруженных систем 24×7 и инфраструктуры, распределенной между несколькими ЦОД/облачными площадками.
Условия: - работу в аккредитованной IT-компании;
- формат работы: удаленно на территории РФ по мск времени с 9.00 до 18.00 ч или 10.00 ч до 19.00 ч;
- ДМС после трех месяцев работы, включая стоматологию и психолога;
- дружную команду профессионалов: ценим юмор, проводим крутые корпоративы, организовываем мастер-классы, квизы и другие мероприятия для неформального общения с коллегами.