Data Engineer с опытом построения и сопровождения платформ обработки данных, разработки ETL/ELT-процессов и работы с корпоративными хранилищами данных. Специалист будет участвовать в развитии DWH, проектировании архитектуры хранения и обработки данных, интеграции различных источников, а также обеспечении надежности, производительности и качества данных.
Навыки, которые нам необходимы:
Разработка и сопровождение ETL/ELT-процессов и data-пайплайнов;
Проектирование и развитие корпоративного хранилища данных;
Интеграция данных из различных источников, включая PostgreSQL и Oracle;
Работа с пакетной и потоковой обработкой данных;
Разработка и сопровождение процессов в Apache Airflow;
Работа с Greenplum, ClickHouse, Kafka, S3, HDFS и Hive;
Оптимизация SQL-запросов, моделей данных и производительности систем;
Администрирование баз данных, управление доступами и обеспечение надежности;
Развертывание и сопровождение компонентов платформы с использованием Docker, участие в развитии облачной инфраструктуры и подготовке технической документации;
Опыт работы в роли Data Engineer или на аналогичной позиции;
Уверенное знание SQL;
Практический опыт работы с PostgreSQL;
Опыт работы с Greenplum и понимание принципов MPP-архитектуры;
Практический опыт работы с ClickHouse;
Опыт работы с Oracle;
Опыт разработки и сопровождения процессов в Apache Airflow;
Практический опыт работы с Apache Kafka;
Понимание принципов потоковой и пакетной обработки данных;
Опыт работы с S3 или S3-совместимыми объектными хранилищами;
Опыт работы с HDFS и понимание принципов распределенного хранения данных;
Практический опыт работы с Apache Hive, включая внешние таблицы;
Понимание принципов работы Hadoop-экосистемы;
Практический опыт работы с Docker;
Опыт администрирования баз данных;
Опыт управления пользователями, ролями и правами доступа;
Навыки оптимизации SQL-запросов и производительности баз данных;
Знание принципов проектирования корпоративных хранилищ данных и моделей данных;
Опыт построения и развития корпоративных DWH и Data Lake;
Знание Debezium или аналогичных решений;
Опыт работы с Kubernetes;
Опыт использования dbt;
Опыт работы с Apache Spark;
Знание Python для разработки процессов обработки и интеграции данных;
Опыт настройки мониторинга с использованием Prometheus и Grafana;
Понимание принципов Data Governance, Data Quality и Data Contracts.