Москва
В команде разрабатывается ML-система, определяющая ситуации отсутствия на складе и аномалии в продажах, которая в режиме, близком к реальному времени, выявляет потенциальные проблемы с наличием товара и отправляет соответствующим сотрудникам магазинов для оперативной проверки и выкладки.
Мы строим сквозные пайплайны, которые собирают данные из разных источников (онлайн и оффлайн-продажи, ERP, внешние API), очищают, трансформируют и подготавливают их для моделей машинного обучения (бустинг и нейронные сети). От этого качества пайплайнов зависит точность прогноза и миллионы управленческих решений в закупках и логистике.
Тебе предстоит:
• Разрабатывать и оптимизировать Spark-пайплайны для масштабной обработки данных (более 200 миллионов строк в день).
• Настройка хранения и доступности данных в СХД.
• Автоматизировать интеграцию данных: продажи, акции, цены, остатки, погода, календари.
• Работать в связке с Data Science-командой, обеспечивая стабильный и качественный поток данных для моделей.
• Участвовать в развитии платформы прогнозирования будущего, делая ее более надежной, масштабируемой и удобной.
Наша стек
• PySpark{2,3} / Spark SQL
• Hadoop / Hive / Trino / S3 / clickhouse / postgres / greenplum
• Расход воздуха
• Python3
• Docker, YARN / k8s
• pytest