Проект Банка ТОП-3! Команда проекта разрабатывает Data Insight — сервис для построения Data Lineage на различных технологических стеках хранения и обработки данных: от традиционных СУБД (Oracle, PostgreSQL, Greenplum) до Hadoop-экосистемы (Hive, Spark и др.).
Твои задачи:
- Разрабатывать функциональность сервиса на Python
- Строить Data Lineage на логическом уровне витрин на основе существующего графа движения данных на табличном уровне
- Реализовывать обработку, преобразование и агрегацию связей между объектами данных
- Работать с большими объемами данных с использованием PySpark, pandas, SQL
- Работать с Hadoop-стеком: HDFS, Spark, Hive
- Дорабатывать существующий фреймворк автоматизированного тестирования
- Разрабатывать и поддерживать автотесты для создаваемой функциональности
- Участвовать в анализе и устранении дефектов
Что мы ждем от тебя:
- Опыт разработки на Python от 2 лет
- Практический опыт работы с PySpark и pandas
- Отличное знание SQL
- Опыт работы со стеком Hadoop: HDFS, Spark, Hive
- Понимание принципов обработки больших объемов данных
- Опыт написания автоматизированных тестов на Python
- Готовность отвечать за качество разработанной функциональности и ее автоматизированную проверку
- Умение разбираться в существующем коде и самостоятельно решать технические задачи
Будет плюсом
- Опыт работы с Data Lineage, Data Governance или Metadata Management
- Опыт с Oracle, PostgreSQL, Greenplum
- Понимание принципов построения DWH и витрин данных
- Опыт работы с графовыми структурами данных
- Опыт использования pytest или аналогичных инструментов тестирования
Что мы обеспечиваем:
- Внутренние семинары, митапы, мы очень любим учиться новому
- ДМС со стоматологией для сотрудников и скидку на покупку ДМС для ближайших членов семьи
- Технику для комфортной работы
- Сессии профессионального развития персонала, результатом которой является план индивидуального развития каждого сотрудника