Senior / TL Data engineer

СБЕР

Senior / TL Data engineer

Описание вакансии

Наша команда занимается амбициозной и стратегически важной задачей – построение единого хранилища данных блока B2C - централизованное и эталонное место хранения данных. Мы ищем сильного инженера данных для работы с крупными распределенными системами. Наш стек строится вокруг экосистемы Hadoop, и мы активно развиваем платформу в сторону Data Lakehouse на базе Apache Iceberg и Data Streamhouse на базе Kafka и Apache Flink. Вам предстоит работать с высоконагруженными системами, потоковой обработкой и участвовать в построении единого хранилища данных компании.

Мы предлагаем:

· Интересные задачи по построению Data Lakehouse на базе Apache Spark и Apache Iceberg.

· Работу с большими объемами данных и современным стеком технологий.

· Возможность влиять на архитектурные решения.

Ключевые технологии в вакансии: SQL, Java, Scala, Python, Apache Spark, Apache Iceberg, Apache Hadoop, Greenplum, Gluten, Velox, Oozie, Jenkins, Doker.

Обязанности

Разработка и оптимизация витрин данных:

  • проектирование и реализация эффективных ETL и ELT процессов для витрин данных с использованием Apache Spark и Greenplum. Обеспечение высокой производительности и отказоустойчивости пайплайнов.

Архитектура данных:

  • поддержание и развитие текущих пайплайнов обработки данных на Hadoop с использованием Apache Spark.
  • разработка предложений по развитию Data Lakehouse, внедрение best practices работы с Apache Iceberg (оптимизация партиционирования, compaction, time travel).

Инженерные практики:

  • реализация механизмов инкрементальной загрузки данных для минимизации времени обработки и нагрузки на источники.
  • разработка и документирование API (на Java или Scala) для доступа к данным витрин и сервисам семантического слоя.

Производительность и качество:

  • глубокая оптимизация Spark-приложений, включая использование векторного движка Gluten/Velox для ускорения рабочих нагрузок.
  • разработка решений для сверки и контроля качества данных (Data Quality) с использованием Spark и Python.
  • DevOps и CI/CD: Внедрение разработанных решений в продуктовую среду. Настройка пайплайнов сборки и деплоя в Jenkins, управление зависимостями задач в Oozie или современных оркестраторах.

Коммуникация: Взаимодействие с внутренними бизнес заказчиками для уточнения и согласования требований, презентация доработок сервиса

Требования

  • уверенное владение языками: SQL, Java (или Scala), Python (как вспомогательный для ad-hoc анализа и DQ).
  • глубокое понимание экосистемы Apache Hadoop (HDFS, YARN) и опыт работы с ней в продакшене.
  • опыт разработки пайплайнов на Apache Spark (Core, SQL, Structured Streaming) уровня не ниже middle.
  • понимание форматов хранения данных (Parquet, ORC, Avro) и современных подходов к управлению Data Lakehouse (обязательно знание Apache Iceberg).
  • опыт оптимизации производительности Apache Spark (настройка ресурсов, устранение перекосов данных, работа с memory, оптимизация shuffle).

Будет большим плюсом:

  • опыт внедрения промышленных пайплайнов пакетной передачи данных.
  • опыт внедрения Gluten/Velox или аналогичных векторизованных движков.
  • навыки сборки и развертывания Doker-образов приложений.

Условия

  • офисный формат работы (м Кутузовская)
  • корпоративный спортзал и зоны отдыха
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • регулярные митапы и развитое DS-community
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких
  • вознаграждение за рекомендацию друзей в команду Сбер.
Посмотреть контакты работодателя

Похожие вакансии

СБЕР
  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

Рекомендуем
Мокка

Tech Lead DWH

Мокка

  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Цифровой аудит
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

VK
  • Москва

  • Не указана

Эвокарго

Lead Data Engineer

Эвокарго

  • Москва

  • Не указана

585, Холдинг

AI Lead

585, Холдинг

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

ProfiStaff
  • Москва

  • от 500000 RUR

СБЕР
  • Москва

  • от 500000 RUR

МАГНИТ, Розничная сеть

Инженер данных

МАГНИТ, Розничная сеть

  • Москва

  • от 500000 RUR

РДП Энтерпрайз

Tech Lead (PCEF)

РДП Энтерпрайз

  • Москва

  • от 500000 RUR

Ведущий разработчик аналитики данных (гибрид)

Корпоративные Информационные Технологии

  • Москва

  • от 500000 RUR

СИНЕРГИЯ
  • Москва

  • от 500000 RUR

WINLINE
  • Москва

  • от 500000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию