Москва
Метро: Библиотека им.ЛенинаМы — команда платформы данных в направлении Trust & Safety. Делаем данные и признаки для моделей машинного обучения, которые используются в антифроде, модерации контента и других продуктах. У нас есть как потоковая платформа (Databus/Kafka + Flink + Redis/Cassandra), так и “озеро” данных на S3/Apache Iceberg с доступом через Trino.
Мы ищем дата-инженера, который обеспечит расчёт и поставку признаков для ML-моделей — от чтения сырых событий до записи финальных значений в онлайн- и офлайн-хранилища.
Вам предстоит:
4–5+ лет опыта в роли Data Engineer / Backend+Data;
Уверенный опыт работы с Kafka‑подобными очередями (Databus/Kafka): продюсеры/консьюмеры, партиционирование, ключи, обработка ошибок;
Практический опыт со streaming‑движком (желательно Flink; Spark Structured Streaming подойдёт, если есть реальный прод‑опыт);
Опыт работы с Redis или Cassandra как онлайновым хранилищем данных/признаков;
Опыт работы с S3‑подобным хранилищем и табличным форматом (Iceberg/Delta/Hudi) и доступа к ним через SQL‑движок (Trino/Presto/Spark SQL);
Отличное знание SQL и опыт работы с ClickHouse;
Python на уровне уверенной разработки data‑скриптов и сервисной логики;
Опыт настройки и сопровождения пайплайнов в Airflow;
Понимание задач ML‑пайплайнов: train/serve skew, пересчёты признаков, влияние задержек и потерь событий.
Потоковая обработка и очереди: Databus(Redpanda)/Kafka, Apache Flink (или Spark Structured Streaming при готовности переучиться на Flink (java));
Онлайновое хранение признаков: Redis, Cassandra;
Хранение и офлайн‑фичи: S3 + Apache Iceberg, доступ через Trino;
Аналитическое хранилище: ClickHouse;
Оркестрация и обработка: Airflow, Python, dbt (для batch‑части и моделирования в DWH);
Плюсом будет опыт с одним из feature‑store решений (Feast или аналоги) — многие компани.