Компания КОМС является разработчиком собственной системы мониторинга и сопровождает несколько крупных продуктивных инсталляций в закрытых контурах заказчиков.
Мы в поисках DevOps/SRE Engineer с сильной экспертизой PostgreSQL, который станет одним из владельцев стабильности продукта и будет отвечать не только за эксплуатацию инфраструктуры, но и за системное повышение надёжности, производительности и наблюдаемости решения.
Основные задачи:
- Поддержка и развитие продуктивной инфраструктуры приложения в закрытых контурах заказчиков;
- Самостоятельная диагностика и устранение сложных инцидентов третьей линии;
- Поиск причин деградации на уровне Linux, Docker, Kubernetes, PostgreSQL, RabbitMQ, сетевого взаимодействия и приложения;
- Администрирование и тюнинг PostgreSQL, TimescaleDB, Patroni и etcd;
- Анализ блокировок, соединений, медленных запросов и планов выполнения;
- Подготовка требований к SQL-запросам, индексам, миграциям и структуре данных совместно с разработчиками;
- Ревью потенциально тяжёлых запросов и изменений БД перед выходом в production;
- Настройка репликации, резервного копирования, восстановления и процедур аварийного переключения;
- Администрирование и восстановление кластеров RabbitMQ;
- Развитие CI/CD и автоматизации на базе GitLab CI и Ansible;
- Администрирование Docker-инфраструктуры и Kubernetes-кластеров;
- Развитие мониторинга и observability на базе Prometheus, Grafana, Zabbix и ELK/OpenSearch;
- Участие в проектировании архитектуры, сайзинге и подготовке требований к инфраструктурным ресурсам;
- Проведение технических разборов инцидентов и формирование корректирующих мероприятий;
- Автоматизация типовых операций и снижение количества ручных вмешательств.
Мы ожидаем:
- Опыт работы в DevOps/SRE или эксплуатации высоконагруженных систем от пяти лет;
- Глубокое знание Linux и сетевых технологий;
- Сильная практическая экспертиза PostgreSQL;
- Опыт работы с репликацией, резервным копированием и восстановлением PostgreSQL;
- Опыт построения кластеров PostgreSQL с Patroni и etcd;
- Опыт оптимизации SQL-запросов, индексов и параметров PostgreSQL;
- Опыт диагностики проблем взаимодействия приложений и БД;
- Опыт администрирования RabbitMQ;
- Уверенная работа с Docker;
- Практический опыт эксплуатации Kubernetes-кластеров;
- Умение самостоятельно диагностировать сложные production-инциденты;
- Опыт эксплуатации высоконагруженных информационных систем;
- Готовность глубоко погружаться в архитектуру и внутреннее устройство продукта;
- Готовность участвовать в дежурствах третьей линии (предусмотрено участие в ротации третьей линии поддержки. Подключение требуется только к инцидентам, которые не смогли устранить предыдущие линии поддержки).
Желательно:
- Опыт эксплуатации TimescaleDB;
- Опыт работы с геораспределёнными системами и несколькими ЦОД;
- Опыт работы в закрытых или государственных инфраструктурных контурах;
- Опыт работы с Zabbix, ELK или OpenSearch;
- Опыт работы с Prometheus;
- Опыт диагностики приложений на PHP или Go;
- Опыт проведения postmortem и контроля корректирующих мероприятий;
- Опыт работы с FreeIPA;
- Опыт работы с GitLab CI и Ansible.
Наш технологический стек:
Linux, Docker, Kubernetes, PostgreSQL, TimescaleDB, Patroni, etcd, PgBouncer, RabbitMQ, GitLab CI, Ansible, Prometheus, Grafana, Zabbix, ELK/OpenSearch, PHP, Go, Selenium/Selenoid, FreeIPA.
*Не требуется быть экспертом во всех перечисленных технологиях. Наиболее важны Linux, PostgreSQL, Docker, диагностика production-систем, автоматизация и observability.
Мы предлагаем:
- Официальное трудоустройство в стабильной ИТ аккредитованной компании;
- Интересные задачи и возможность влияния на процессы и стек;
- Удаленный формат работы из любого города России;
- Возможность профессионального и карьерного роста;
- Работа в команде профессионалов;
- Возможность получать дополнительное образование, посещать конференции за счет компании;
- Возможность выбирать соц. программу (ДМС или компенсация трат на фитнес/обучение/изучение языков и многое другое).