Data Engineer (Hadoop / Spark)

Детский мир

Data Engineer (Hadoop / Spark)

Описание вакансии

«Детмир Тех» развивает цифровую экосистему группы компаний «Детский мир». Мы создаём продукты для миллионов клиентов и сервисы, которые помогают бизнесу принимать решения на основе данных.

Ищем Data Engineer в команду Big Data Platform. Платформа построена на Hadoop 3 и Apache Spark и является основным источником данных для всей группы компаний.

Главная задача — развивать надёжную и производительную платформу обработки больших объёмов данных: проектировать пайплайны, оптимизировать Spark-приложения, развивать Data Lake и совершенствовать архитектуру Hadoop-кластера.

Чем предстоит заниматься:

  • Разрабатывать и оптимизировать batch-процессы на Apache Spark.
  • Проектировать ETL/ELT-пайплайны для обработки больших объёмов данных.
  • Создавать и поддерживать витрины данных в Hadoop.
  • Оптимизировать Spark jobs: partitioning, shuffle, data skew, использование памяти и ресурсов кластера.
  • Развивать архитектуру Data Lake и подходы к организации и хранению данных.
  • Организовывать загрузку и передачу данных через Kafka и S3 API (MinIO).
  • Автоматизировать процессы с помощью Apache Airflow и Apache NiFi.
  • Поддерживать трансформации данных в dbt Core.
  • Развивать и поддерживать витрины данных в ClickHouse.
  • Оптимизировать запросы и процессы загрузки данных в ClickHouse, разбираться с проблемами производительности.
  • Поддерживать аналитическую платформу на Apache Superset, решать возникающие технические проблемы.
  • Внедрять проверки качества данных и мониторинг пайплайнов.
  • Исследовать причины сбоев и деградации производительности.
  • Помогать аналитикам и дата-сайентистам эффективно работать с платформой.
  • Участвовать в развитии внутренних инструментов и стандартов Data Engineering.
  • Участвовать в развёртывании и эксплуатации компонентов платформы в Kubernetes.

Что для нас важно:

  • От трёх лет опыта работы с Hadoop и Apache Spark.
  • Знание основных компонентов Hadoop и принципов работы HDFS и Spark.
  • Глубокое понимание архитектуры Spark и принципов распределённых вычислений.
  • Опыт разработки и оптимизации Spark batch jobs.
  • Уверенное владение SQL.
  • Опыт проектирования DWH или Data Lake.
  • Опыт построения ETL/ELT-процессов.
  • Практический опыт работы с Apache Airflow.
  • Знание форматов хранения данных.
  • Понимание принципов партиционирования и организации данных в Data Lake.
  • Умение диагностировать проблемы с shuffle, partitioning, data skew, памятью и использованием ресурсов кластера.
  • Умение анализировать производительность распределённых приложений и находить узкие места.
  • Умение писать чистый, тестируемый и поддерживаемый код.
  • Готовность принимать технические решения и отвечать за результат.

Будет преимуществом:

  • Опыт разработки на Scala.
  • Знание Kafka и принципов потоковой обработки данных.
  • Опыт работы с ClickHouse и оптимизации запросов.
  • Опыт работы с Apache Superset.
  • Знакомство с Apache NiFi и dbt Core.
  • Опыт эксплуатации приложений в Kubernetes.
  • Знание Docker, Helm и GitLab CI/CD.
  • Опыт работы с DataHub или другими Data Catalog решениями.
  • Опыт построения мониторинга data-платформ и пайплайнов.
  • Знакомство с VictoriaMetrics, Grafana, Hue или Jupyter.
  • Опыт работы с большими Hadoop-кластерами и высокими объёмами данных.

Наш стек:

Хранение и обработка: Hadoop 3, HDFS, Apache Spark

Доставка и обмен данными: Kafka, S3

Оркестрация и трансформации: Apache Airflow, Apache NiFi, dbt Core

Аналитические хранилища: ClickHouse

Ad-hoc аналитика: Hue, Jupyter

Каталог данных: DataHub

BI и визуализация: Apache Superset, Grafana

Мониторинг: VictoriaMetrics, Grafana

Инфраструктура: Kubernetes, Docker, Helm

CI/CD: GitLab CI/CD

Мы предлагаем:

  • Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;
  • Совокупный доход: оклад + годовой бонус;
  • График работы: 5/2 (гибридный формат работы);
  • Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;
  • Техника для работы;
  • Полис ДМС;
  • Программа Best Benefits;
  • Внутреннее обучение;
  • Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.

Присоединяйтесь к нам и станьте частью истории бренда с историей!

Посмотреть контакты работодателя

Похожие вакансии

ТЕХНОНИКОЛЬ

Data Engineer

ТЕХНОНИКОЛЬ

  • Москва

  • Не указана

Рекомендуем
ИЦ АЙ-ТЕКО

Data Engineer

ИЦ АЙ-ТЕКО

  • Москва

  • Не указана

Рекомендуем
Полицифра

Data Engineer

Полицифра

  • Москва

  • Не указана

Рекомендуем
Домклик
  • Москва

  • Не указана

МФК ВЭББАНКИР

Data Engineer (DWH / NRT)

МФК ВЭББАНКИР

  • Москва

  • до 250000 RUR

Ozon
  • Москва

  • до 250000 RUR

Домклик
  • Москва

  • до 250000 RUR

Data Engineer

Вебпро

  • Москва

  • до 250000 RUR

Флаувау

Senior Data Engineer

Флаувау

  • Москва

  • до 250000 RUR

Ozon
  • Москва

  • до 250000 RUR

ГНИВЦ
  • Москва

  • до 250000 RUR

Мокка
  • Москва

  • до 250000 RUR

ЛОКО-БАНК

Data Engineer

ЛОКО-БАНК

  • Москва

  • до 250000 RUR

СберЗдоровье

Senior ML Engineer (NLP)

СберЗдоровье

  • Москва

  • до 250000 RUR

Профи.ру
  • Москва

  • до 250000 RUR

Компания БКС
  • Москва

  • до 250000 RUR

Selecty

Data Scientist

Selecty

  • Москва

  • до 370000 RUR

Флаувау
  • Москва

  • до 370000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию