DevOps / SRE-инженер

Амбрелла

DevOps / SRE-инженер

Москва, улица Ленинская Слобода, 26

Метро: Автозаводская

Описание вакансии

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Привет! Меня зовут Эля, я HR компании «Амбрелла».
Мы — аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB.
Основной фокус роли — промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона — MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто «поднять базу», а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.

Чем предстоит заниматься: ClickHouse:
— Администрировать продуктивные и тестовые кластеры ClickHouse;
— Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
— Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
— Анализировать системные таблицы ClickHouse и состояние кластера;
— Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
— Планировать горизонтальное масштабирование ClickHouse-кластера;
— Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
— Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
— Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
— Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
— Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
— Разрабатывать и проверять backup/restore и disaster recovery;
— Настраивать мониторинг, алерты и дашборды по ClickHouse;
— Готовить Ansible playbooks / roles, runbook’и, инструкции, чек-листы и технические отчёты.

MariaDB:
— Администрировать продуктивные и тестовые инсталляции MariaDB;
— контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
— Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
— Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
— Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
— Настраивать, сопровождать и диагностировать Galera Cluster;
— Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
— Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
— Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
— Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
— Настраивать TLS/SSL для клиентских подключений и репликации;
— Настраивать мониторинг, алерты, дашборды и runbook’и по MariaDB.

Production, автоматизация и взаимодействие:
— Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
— Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
— Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
— Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
— Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
— Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
— Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
— Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.

Обязательные требования:
— Практический опыт промышленной эксплуатации ClickHouse;
— Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
— Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
— Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
— Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
— Опыт настройки TLS/SSL для ClickHouse;
— Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
— Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
— Опыт настройки и диагностики репликации MariaDB;
— Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
— Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
—Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
— Опыт эксплуатации Linux-серверов;
— Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
— Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
— Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
— Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
— Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
— Умение писать техническую документацию: инструкции, runbook’и, чек-листы, postmortem-отчёты.

Желательные требования:
— Опыт или уверенное понимание Galera Cluster;
— Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
— Опыт работы с большими объёмами данных: десятки или сотни ТБ;
— Опыт работы с ClickHouse Keeper или ZooKeeper;
— Опыт эксплуатации ClickHouse / MariaDB на bare metal;
— Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
— Опыт нагрузочного тестирования ClickHouse и MariaDB;
— Опыт построения процедур disaster recovery;
— Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
— Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
— Опыт проведения регламентных работ с минимальным downtime;
— Опыт аудита продуктивных инсталляций у заказчиков.

Что важно в кандидате:
— Инженерная аккуратность и понимание рисков production-среды;
— Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
— Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
— Клиентоориентированность и зрелая коммуникация;
— Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
— Способность лидировать технические встречи, фиксировать решения и следующие шаги;
— Готовность документировать решения и передавать знания команде.

Условия:
— Постоянная занятость;
— Работа с продуктивной, тестовой и лабораторной инфраструктурой;
— Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
— Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.

Всегда рады новым талантам и новым успехам наших сотрудников!

Посмотреть контакты работодателя

Адрес

Похожие вакансии

Нетбелл

DevOps / SRE Engineer

Нетбелл

  • Москва

  • Не указана

Рекомендуем
Юрент

Team Lead DevOps

Юрент

  • Москва

  • Не указана

Рекомендуем
Ньютон Технологии

SRE-инженер (финтех)

Ньютон Технологии

  • Москва

  • Не указана

Рекомендуем
CyberOK
  • Москва

  • Не указана

Рондем

DevOps-инженер

Рондем

  • Москва

  • Не указана

Клируэй Текнолоджис

SRE-инженер

Клируэй Текнолоджис

  • Москва

  • Не указана

Северсталь
  • Москва

  • Не указана

Marfatech
  • Москва

  • Не указана

Playerok
  • Москва

  • от 300000 RUR

Клируэй Текнолоджис

Senior DevOps engineer

Клируэй Текнолоджис

  • Москва

  • до 420000 RUR

Amex Development
  • Москва

  • до 420000 RUR

edna
  • Москва

  • до 420000 RUR

Компэл

DevOps-инженер

Компэл

  • Москва

  • до 420000 RUR

АФЛТ-Системс
  • Москва

  • до 420000 RUR

DatsTeam
  • Москва

  • до 420000 RUR

Voximplant

DevOps Engineer

Voximplant

  • Москва

  • до 420000 RUR

IndigoSoft
  • Москва

  • до 3000 USD

VK
  • Москва

  • до 3000 USD

Aston
  • Москва

  • до 3000 USD

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию