Senior Data Engineer в Trust & Safety

RWB (Wildberries & Russ)

Senior Data Engineer в Trust & Safety

Москва

Метро: Библиотека им.Ленина

Описание вакансии

Мы — команда платформы данных в направлении Trust & Safety. Делаем данные и признаки для моделей машинного обучения, которые используются в антифроде, модерации контента и других продуктах. У нас есть как потоковая платформа (Databus/Kafka + Flink + Redis/Cassandra), так и “озеро” данных на S3/Apache Iceberg с доступом через Trino.

Мы ищем дата-инженера, который обеспечит расчёт и поставку признаков для ML-моделей — от чтения сырых событий до записи финальных значений в онлайн- и офлайн-хранилища.

Вам предстоит:

  • ​​​Проектировать и разрабатывать потоковые процессы, которые читают события из Databus/Kafka и считают онлайн‑признаки, записывая их в Redis и Cassandra;
  • Проектировать и разрабатывать пакетные процессы, которые читают данные из S3/Iceberg через Trino, считают офлайн‑признаки и пишут результаты обратно в S3/Iceberg и/или ClickHouse;
  • Следить за тем, чтобы один и тот же признак был согласован между обучением и продакшеном (одна логика расчёта, единый контракт);
  • Настраивать расписания, пересчёты и бэки, чтобы признаки обновлялись вовремя и выдерживали SLA по свежести;
  • Работать с качеством данных: добавлять проверки, мониторить аномалии, разбирать инциденты, когда “признак поехал”;
  • Совместно с DS и аналитиками придумывать новые признаки и помогать перевести их из экспериментальных скриптов в стабильные пайплайны.
Вы нам подходите, если есть:
  • 4–5+ лет опыта в роли Data Engineer / Backend+Data;

  • Уверенный опыт работы с Kafka‑подобными очередями (Databus/Kafka): продюсеры/консьюмеры, партиционирование, ключи, обработка ошибок;

  • Практический опыт со streaming‑движком (желательно Flink; Spark Structured Streaming подойдёт, если есть реальный прод‑опыт);

  • Опыт работы с Redis или Cassandra как онлайновым хранилищем данных/признаков;

  • Опыт работы с S3‑подобным хранилищем и табличным форматом (Iceberg/Delta/Hudi) и доступа к ним через SQL‑движок (Trino/Presto/Spark SQL);

  • Отличное знание SQL и опыт работы с ClickHouse;

  • Python на уровне уверенной разработки data‑скриптов и сервисной логики;

  • Опыт настройки и сопровождения пайплайнов в Airflow;

  • Понимание задач ML‑пайплайнов: train/serve skew, пересчёты признаков, влияние задержек и потерь событий.

Стек технологий
  • Потоковая обработка и очереди: Databus(Redpanda)/Kafka, Apache Flink (или Spark Structured Streaming при готовности переучиться на Flink (java));

  • Онлайновое хранение признаков: Redis, Cassandra;

  • Хранение и офлайн‑фичи: S3 + Apache Iceberg, доступ через Trino;

  • Аналитическое хранилище: ClickHouse;

  • Оркестрация и обработка: Airflow, Python, dbt (для batch‑части и моделирования в DWH);

  • Плюсом будет опыт с одним из feature‑store решений (Feast или аналоги) — многие компани.

Навыки
  • Python
  • SQL
  • Java
  • Cassandra
  • Redis
Посмотреть контакты работодателя

Адрес

Похожие вакансии

Флаувау

Senior Data Engineer

Флаувау

  • Москва

  • Не указана

Рекомендуем
ИК СИБИНТЕК

Senior Data Engineer

ИК СИБИНТЕК

  • Москва

  • Не указана

Рекомендуем
Cloud.ru
  • Москва

  • Не указана

Рекомендуем
X5 Tech
  • Москва

  • Не указана

RWB (Wildberries & Russ)

Data Engineer

RWB (Wildberries & Russ)

  • Москва

  • Не указана

ГНИВЦ
  • Москва

  • Не указана

Астр
  • Москва

  • Не указана

Мокка
  • Москва

  • Не указана

Selecty
  • Москва

  • до 300000 RUR

VK
  • Москва

  • до 300000 RUR

РУСАЛ
  • Москва

  • до 300000 RUR

HeadHunter
  • Москва

  • до 300000 RUR

USETECH
  • Москва

  • до 300000 RUR

Bell Integrator

Data Engineer

Bell Integrator

  • Москва

  • до 300000 RUR

Домклик
  • Москва

  • от 450000 RUR

Медиалогия

DataOps инженер

Медиалогия

  • Москва

  • от 450000 RUR

Профи.ру
  • Москва

  • от 450000 RUR

СБЕР

Data Engineer

СБЕР

  • Москва

  • от 450000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию