Москва, 4-я Магистральная улица, 11с1
Метро: ПолежаевскаяКомпания Clearway Integration — команда архитекторов и консультантов, созданная выходцами из Microsoft Consulting Services. Мы создаём программные продукты для управления и мониторинга больших ИТ-инфраструктур.
Наши решения используются в инфраструктурах масштаба десятков тысяч серверов и рабочих станций, в том числе в крупных финансовых и промышленных организациях.
Мы ищем SRE инженера, который поможет нам сделать наши продукты более надёжными, предсказуемыми и масштабируемыми.
Чем предстоит заниматься:
• Разрабатывать и внедрять практики обеспечения надёжности продуктов: SLI/SLO, требования к отказоустойчивости, контроль рисков изменений.
• Проектировать и проверять сценарии высокой доступности, восстановления после сбоев и деградации систем.
• Проводить нагрузочное тестирование, анализировать производительность и масштабирование решений на больших инфраструктурах.
• Развивать систему наблюдаемости (monitoring, logging, alerting) и помогать командам получать объективную картину состояния продуктов.
• Участвовать в расследовании сложных инцидентов, проводить анализ первопричин (RCA) и внедрять улучшения для предотвращения повторений.
• Участвовать в архитектурных обсуждениях продуктов с фокусом на надёжность, безопасность и эксплуатацию.
• Создавать технические рекомендации и практики эксплуатации решений для внутренних команд и крупных заказчиков.
Что мы ожидаем:
• Опыт работы в роли SRE / DevOps / Platform Engineer от 3 лет.
• Понимание принципов построения отказоустойчивых систем.
• Опыт работы с Kubernetes и современными инструментами инфраструктуры.
• Практический опыт работы с Linux.
• Опыт работы с мониторингом и observability-инструментами.
• Понимание процессов эксплуатации production-систем: инциденты, RCA, postmortem.
• Опыт работы с PostgreSQL, ClickHouse или другими высоконагруженными системами хранения данных.
• Понимание сетевой инфраструктуры и вопросов безопасности.
• Умение писать техническую документацию.
Что мы предлагаем: