Мы — команда разработки OneDWH, единого DWH для всей компании. Он приходит на смену разрозненным решениям, которые команды строили каждая под себя: вместо множества обособленных хранилищ — одно общее. Данные живут в кластерах YTsaurus. В зоне ответственности команды — несколько доменов:
- Data Catalog — каталог, в котором поставщики данных публикуют метаинформацию о своих таблицах и зависимостях между ними. Благодаря этому можно проследить всю цепочку — от сырых логов до готовых витрин
- ETL-фреймворк — таблицы и работающие с ними процессы (YQL, Python и Spark) описаны декларативно в отдельном репозитории. У фреймворка собственный оркестратор и движок динамического распределения ETL между кластерами — это сокращает time-to-market поставок и оптимизирует потребление ресурсов. Также мы обеспечиваем доступность критичных данных даже при даунтайме одного из кластеров YTsaurus
- Data Quality (DQ) — следим за соблюдением сроков поставок критичных данных и уведомляем пользователей об их срывах. Развиваем проверки качества данных
Задачи
- Развивать платформу DWH как продукт
- Делать удобные инструменты для дата-инженеров: поиск данных, заведение и сопровождение ETL
- Делать удобные инструменты для аналитиков, которые работают с данными в OneDWH
- Работать с графами зависимостей ETL-процессов: планирование выполнения, динамическое распределение по кластерам, оптимизация
- Строить отказоустойчивые решения для критичных данных
Требования
- Опыт разработки сервисов на Go
- Уверенное владение PostgreSQL
- Опыт работы с Kafka
- Хорошее знание алгоритмов и структур данных, особенно графовых
Будет плюсом
- Знакомство с Java, Python, Spark или YTsaurus
- Опыт в области DWH, ETL или дата-инженерии
- Опыт работы с Airflow
- Опыт работы с CI, CD-пайплайнами в GitLab или другой системе
- Желание тесно работать с дата-инженерами и аналитиками: вникать в их задачи и делать продукты, которые упрощают им жизнь