Описание вакансии
Чем предстоит заниматься
• Развивать real-time хранилище и дата-платформу.
• Строить полный data flow: от получения данных из источников и их транспортировки до обработки, хранения и предоставления потребителям.
• Проектировать архитектуру дата-платформы с учётом роста объёмов данных, нагрузки, производительности и отказоустойчивости.
• Развивать и эксплуатировать ClickHouse-кластеры: репликация, шардирование, резервное копирование, восстановление, масштабирование и оптимизация производительности.
• Проектировать и развивать потоки данных на базе Kafka и других компонентов платформы.
• Работать с объектными и распределёнными хранилищами: S3, Ceph.
• Развивать observability дата-платформы: метрики, мониторинг, алертинг, сбор и анализ логов.
• Искать узкие места и разбирать проблемы на всём пути данных — от источника и сети до брокера, хранилища и конечного потребителя.
• Работать в тесной связке с DevOps-командой и участвовать в инфраструктурных и архитектурных решениях на стыке Data Engineering и DevOps.
Наш стек :
ClickHouse, Kafka, Ceph, S3, PostgreSQL, MongoDB, Airflow, Celery, Superset, VictoriaMetrics.
Мы ожидаем:
• От 5 лет опыта в Data Engineering или смежных инженерных направлениях.
• От 3 лет коммерческого опыта с ClickHouse: глубокое понимание его архитектуры, движков таблиц, оптимизации запросов, партиционирования, шардирования и репликации.
• Опыт проектирования и эксплуатации распределённых data-систем под высокой нагрузкой.
• Понимание принципов работы Kafka и архитектуры потоковой обработки данных.
• Уверенное владение Linux и понимание сетевого стека: TCP/IP, DNS, балансировка, диагностика сетевых проблем.
• Опыт построения и эксплуатации data pipelines и работы с оркестраторами (Airflow или аналогами).
• Понимание принципов работы объектных и распределённых хранилищ.
• Понимание observability: какие метрики необходимо собирать, как строить мониторинг и алертинг, как организовывать централизованный сбор и анализ логов.
• Знание принципов CI/CD и DevOps-подходов применительно к дата-платформам.
• Понимание принципов построения масштабируемых и отказоустойчивых распределённых систем.
Для нас Data Engineer — это не только работа с данными и написание ETL/ELT-процессов. Нам важно, чтобы инженер понимал архитектуру и внутреннее устройство систем, через которые проходят данные, мог находить проблемы на разных уровнях и участвовать в проектировании и развитии дата-платформы целиком.
Посмотреть контакты работодателя