Инженер данных / Data Engineer

Федеральное автономное учреждение «Национальный институт аккредитации» (ФАУ НИА)

Инженер данных / Data Engineer

Москва, Кольцевая линия, метро Павелецкая

Метро: Павелецкая

Описание вакансии

ФАУ НИА — оператор ФГИС Росаккредитации, занимающийся разработкой информационных систем, обработкой данных, научными исследованиями, издательской деятельностью и продвижением стандартов оценки соответствия.
Мы развиваем экосистему работы с данными и ищем эксперта, который умеет превращать хаос legacy-структур в стройную архитектуру. Нам нужен человек, готовый погрузиться в недра ФГИС, восстановить скрытые связи и построить эффективные витрины данных для аналитиков и бизнеса.

Чем предстоит заниматься:

1. Анализ и документирование текущих структур данных

  • Проведение реверс-инжиниринга баз данных ФГИС и корпоративного аналитического хранилища данных (DWH).
  • Описание логических и физических моделей: таблиц, полей, типов данных, первичных и внешних ключей, существующих взаимосвязей.
  • Выявление недокументированных полей и скрытых зависимостей между сущностями.
  • Разработка и поддержка наглядных ER-диаграмм в нотациях Crow’s Foot, IDEF1X или UML с помощью draw.io, DBeaver, DataGrip или аналогичных инструментов.
  • Создание карты источника (Source-to-Target Mapping): от сырых слоёв ФГИС до витрин аналитического хранилища.

2. Анализ и документирование потоков и механизмов движения данных

  • Инвентаризация существующих скриптов загрузки: SQL, Python, bash, хранимые процедуры.
  • Инвентаризация средств оркестрации и смежных инструментов: Apache Airflow, Yandex DataLens, MS SSIS, Cron, проприетарные системы ФГИС.
  • Построение схем движения данных (Data Flow Diagrams, DFD): источники, этапы трансформаций — staging, ODS, DM, — конечные витрины и отчёты.
  • Фиксация SLA потоков: периодичности, длительности и зависимостей между задачами.
  • Формирование реестра и каталога данных с указанием бизнес-наименований, технических полей и восстановленных правил расчёта.

3. Проектирование и создание представлений и витрин данных

  • Анализ требований аналитиков данных и бизнес-заказчиков к отчётности.
  • Проектирование логических и физических моделей витрин данных: выбор гранулярности, состава полей и типов агрегаций.
  • Реализация материализованных представлений и витрин данных на SQL с использованием DDL/DML с учётом производительности и стратегии обновления: инкрементальная загрузка, полная перезагрузка (full refresh).
  • Документирование витрин: источники, правила расчёта и периодичность обновления.
  • Оптимизация витрин: индексы, партиционирование, вакуумирование, анализ статистики.

4. Проектирование и разработка средств построения потоков данных

  • Разработка, рефакторинг и поддержка скриптов загрузки: SQL-пайплайны, Python, bash, Spark-задания.
  • Проектирование графов оркестрации (DAG) в Airflow или аналогичных инструментах: определение зависимостей, политик повторных попыток и алертов.
  • Реализация пайплайнов для последовательной загрузки и очистки данных между слоями staging, ODS, DDS и DM.
  • Внедрение SCD (Slowly Changing Dimensions) типов 1 и 2 при необходимости.
  • Написание воспроизводимых и тестируемых скриптов с логированием и обработкой ошибок.

Мы ожидаем от тебя:

Опыт и технические навыки

  • Опыт работы с реляционными базами данных: PostgreSQL, Oracle, MS SQL, MySQL.
  • Глубокое знание системных каталогов и информационных схем, включая information_schema.
  • Навыки профилирования запросов.
  • Продвинутый уровень владения SQL: MERGE, оконные функции, CTE, сложные JOIN, написание запросов для анализа связей и генерации документации.
  • Знание инструментов моделирования и визуализации: draw.io, DBeaver (ERD), DataGrip, dbdiagram.io, ER/Studio или PowerDesigner.
  • Понимание принципов проектирования витрин данных и dimensional modeling по Кимбаллу, нормализации и денормализации, схем «звезда» и «снежинка».
  • Умение переводить требования аналитиков в физическую схему витрины.
  • Опыт разработки ETL/ELT-процессов на SQL, Python и bash.
  • Понимание паттернов инкрементальной загрузки и SCD.
  • Опыт работы с Apache Airflow или аналогичными инструментами: Prefect, Dagster, SSIS.
  • Умение писать DAG и задачи, использовать операторы и настраивать сенсоры.
  • Опыт создания качественной технической документации с примерами SQL и кода.

Личные качества

  • Педантичность и системное мышление, необходимые для описания хаотичных legacy-структур.
  • Умение превращать сотни таблиц в одну понятную схему.
  • Коммуникабельность и готовность выяснять требования у аналитиков и разработчиков ФГИС.

Будет преимуществом

  • Опыт работы со спецификой ФГИС: системами ФНС, ФТС, ЕГАИС, «Честный ЗНАК», ГИС ЖКХ или другими государственными информационными системами.
  • Знание типовых особенностей обмена данными в государственных информационных системах.
  • Навыки написания Python-скриптов для автоматизации сбора метаданных и выгрузки схем в Confluence или Excel.
  • Опыт использования Data Catalog: DataHub, OpenMetaData, Collibra, Amundsen.
  • Опыт работы с dbt (data build tool), трансформациями и управлением витринами через dbt.
  • Понимание Data Vault 2.0 или Anchor Modeling, а также продвинутых моделей для промежуточных слоёв.
  • Навыки тестирования пайплайнов: написание unit-тестов для проверки количества записей, уникальности ключей и отсутствия дублей.
  • Навыки профилирования производительности и поиска узких мест в загрузке на стороне источника или хранилища.
  • Опыт работы с Jupyter или Zeppelin для демонстрации аналитикам примеров связей между таблицами.

​​​​​Мы предлагаем:

  • Работу в офисе класса "А" БЦ Павелецкая плаза (в шаговой доступности от метро)
  • Официальное трудоустройство и полностью белая заработная плата
  • График работы 5/2 с 09.00 до 18.00 (в пятницу до 17.30)
  • Комфортный формат работы (офис на испытательном сроке, гибрид на основном)
  • Конкурентный уровень дохода (обсуждается с успешным кандидатом по итогам интервью)
  • Премии (ежемесячные, квартальные, годовые)
  • Социальные и иные гарантии, предусмотренные ТК РФ
  • Возможность самореализации в надежной и стабильной компании

Будем очень рады видеть в своей команде активного, открытого, честного, ответственного и позитивного будущего коллегу. С нетерпением ждем отклик!

Посмотреть контакты работодателя

Адрес

Похожие вакансии

СБЕР

Data Engineer

СБЕР

  • Москва

  • Не указана

Рекомендуем

Аналитик данных

СМОТРИМ (ООО Платформа Трим)

  • Москва

  • Не указана

Рекомендуем
Вычислительные решения

Аналитик данных

Вычислительные решения

  • Москва

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Страховая компания Сбербанк страхование

Data Engineer в команду Страхового потенциала B2B

Страховая компания Сбербанк страхование

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СИНЕРГИЯ
  • Москва

  • Не указана

СБЕР

Data Engineer

СБЕР

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

СБЕР

Data Analyst

СБЕР

  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию