писать код обработки данных на Scala DataFrame API (Apache Spark), с избегая SQL-подхода
отвечать за Performance Tuning, устранение data skew и эффективное использование ресурсов кластера
моделировать данные для корпоративного DWH с использованием Dimensional Modeling или Data Vault
проектировать схемы, которые обеспечивают историчность, масштабируемость и надежность аналитических витрин
поставлять командам DS/ML готовые к обучению датасеты. Понимать особенности жизненного цикла ML-моделей — от подготовки признаков до их мониторинга в production-среде
обрабатывать массивы текстов, изображений или логов, а также встраивать результаты работы генеративных моделей (LLM) в классические ETL-пайплайны аналитики
читать планы выполнения запросов через Catalyst Optimizer, декомпилировать физические операции и находить узкие места производительности непосредственно в алгоритмах трансформации данных
развивать инженерную культуру в команде: проводить код-ревью, вести разработку по GitFlow, писать модульные тесты и поддерживать высокий стандарт чистоты и поддерживаемости кодовой базы
преобразовывать запросы бизнеса в четкие технические спецификации: определять требования к архитектуре потоков данных, частоте обновлений и формату хранения информации.
Требования
релевантный опыт работы от 3 лет на позиции Data-аналитика или Аналитика DWH\глубокой продуктовой аналитике
опыт реализации проектов исключительно на Scala API DataFrame Apache Spark без использования SQL
опыт полного цикла дизайна экспериментов от формулировки метрики успеха до пост-анализа результатов
глубокое понимание статистики
умение доказывать бизнесу влияние фичей на показатели, исключая внешние факторы и сезонность
практический опыт применения продвинутых методов: синтетический контроль (Synthetic Control/DID), инструментальные переменные (IV), пропенсити-скор матчинг (PSM).
обязателен опыт вывода моделей в продакшен и их последующей эксплуатации
организация процессов переобучения моделей.
интеграция выводов модели в принятие решений смежными командами через API или автоматизированные алерты.
свободное владение pandas для сложного трансформирования исследовательских датасетов
подтвержденный опыт нахождения инсайтов, которые привели к изменению стратегии продукта и принесли измеримый финансовый результат (рост Retention, LTV, снижение CAC, прямое влияние на выручку или маржинальность)
способность декомпозировать глобальные цели компании до конкретных действий аналитики
опыт проектирования версионируемых витрин данных и семантических слоев (BI-семантика)
создание безопасной среды, позволяющей джуниор-аналитикам самостоятельно писать запросы без риска обрушить БД или получить некорректные данные.
Условия
офисный формат работы: г. Москва
ежегодный пересмотр зарплаты и годовая премия
более 400 образовательных программ в СберУниверситете для твоего развития
спортзал и зоны отдыха
расширенный ДМС, льготное страхование для семьи
гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
подписка Прайм с возможностью совместного использования на трёх близких
вознаграждение за рекомендацию друзей в команду Сбера