Разработка и поддержка ETL/ELT-процессов, пайплайнов и витрин данных.
Интеграция разнородных источников: ERP, MES, PMIS, Excel, внешние системы.
Работа с Apache Airflow, Spark, Kafka; при необходимости — другие инструменты оркестрации и потоковой обработки.
Проектирование и оптимизация моделей данных для DWH, data lake/lakehouse, feature stores и витрин под аналитику и ML.
Работа с СУБД: ClickHouse, Greenplum, PostgreSQL или аналогами.
Подготовка данных для AI/ML/LLM: очистка, нормализация, разметка, векторизация, создание датасетов для обучения и дообучения моделей.
Понимание сценариев использования LLM в data-инженерии: генерация и валидация кода, автодокументирование пайплайнов, извлечение сущностей из текстов, обогащение метаданных, классификация и тегирование данных.
Обеспечение качества данных: валидация, контроль полноты, мониторинг загрузок, обработка инцидентов.
Взаимодействие с аналитиками, архитекторами, разработчиками, ML-инженерами и владельцами данных.
Документирование решений, регламентов обновления и правил контроля качества.
Требования:
Уверенное владение SQL и Python.
Практический опыт с Airflow, Spark, Kafka или аналогичными инструментами оркестрации и потоковой обработки.
Понимание принципов DWH, data lake/lakehouse, витрин данных, feature stores.
Опыт работы с различными моделями данных: реляционная, колоночная, документоориентированная, графовая, key-value, векторная.
Опыт работы с ClickHouse, Greenplum, PostgreSQL, векторными СУБД или аналогами.
Понимание процессов ETL/ELT, качества данных, мониторинга и обработки ошибок.
Желателен опыт подготовки данных для AI/ML/LLM или работы в команде с ML-инженерами.
Понимание базовых принципов работы LLM и сценариев их применения в data-инженерии.
Способность работать с разрозненными источниками и неполными данными
Преимуществом будет:
Опыт работы в Kubernetes-контуре: контейнеризация пайплайнов, Helm, CI/CD, observability.
Опыт в госкорпорации, промышленности, холдинге или регулируемой среде.
Знание векторных баз данных, RAG-паттернов, эмбеддингов и работы с неструктурированными данными.
Понимание требований ИБ, разграничения доступа и работы с чувствительными данными.
Опыт настройки мониторинга (Grafana, Prometheus, ELK) и алертинга