Data Engineer

Data Engineer

Москва, Ленинградское шоссе, 16с9

Метро: Войковская

Описание вакансии

Цели проекта: участие в развитии сбора, обработки, трансформации и представления данных.

Чем предстоит заниматься:

  • проектированием и разработкой слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
  • разработкой и внедрением кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
  • формализацией бизнес-правил качества данных в код, настройкой уровней доверия к источникам и правил выживания (survivorship rules);
  • внедрением Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
  • настройкой автоматизированного тестирования данных (Data Quality checks) в пайплайнах.

Чего мы ждем от тебя:

  • SQL и трансформации: продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
  • Python для данных: уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
  • Fuzzy Matching: практический опыт применения библиотек нечёткого поиска и связывания записей (например, Splink, recordlinkage, dedupe, theFuzz);
  • алгоритмы: понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
  • моделирование данных: глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
  • Data Quality: Опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
  • оркестрация и DevOps: опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.

Будет существенным преимуществом:

  • опыт обучения простых ML-моделей (Logistic Regression, XGBoost) или использование Active Learning для классификации дублей;
  • понимание принципов вероятностного связывания записей (Probabilistic Record Linkage, модель Фелледжи-Сантера);
  • опыт работы с графовыми базами данных или графовыми алгоритмами (Connected Components) для разрешения сущностей;
  • знание специфики работы с Greenplum и stream lakehouse.

Посмотреть контакты работодателя

Адрес

Похожие вакансии

RWB (Wildberries & Russ)

Data Engineer (Платформа)

RWB (Wildberries & Russ)

  • Москва

  • Не указана

Рекомендуем
Домклик
  • Москва

  • Не указана

Рекомендуем
ГЛОБУС

Data Engineer

ГЛОБУС

  • Москва

  • Не указана

Рекомендуем

Data analyst

Лоция

  • Москва

  • Не указана

Aston
  • Москва

  • Не указана

Эвокарго

Lead Data Engineer

Эвокарго

  • Москва

  • Не указана

Ecom.tech
  • Москва

  • Не указана

Флаувау

Senior Data Engineer

Флаувау

  • Москва

  • Не указана

ТехВилл
  • Москва

  • до 460000 RUR

Ингосстрах
  • Москва

  • до 460000 RUR

Live Typing
  • Москва

  • до 310000 RUR

Rubius

Data Engineer

Rubius

  • Москва

  • до 310000 RUR

АО «ОТП Банк» (JSC «OTP Bank»)

Senior AI engineer

АО «ОТП Банк» (JSC «OTP Bank»)

  • Москва

  • до 310000 RUR

БАЗИС
  • Москва

  • до 310000 RUR

Точка Сверки

Data Engineer

Точка Сверки

  • Москва

  • до 310000 RUR

Aston
  • Москва

  • до 310000 RUR

билайн

Data Engineer (Scala)

билайн

  • Москва

  • до 310000 RUR

Альфа-Банк
  • Москва

  • до 310000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию