Ведущий инженер данных (LLM)

ЦРТ | Группа компаний

Ведущий инженер данных (LLM)

Москва, 2-й Сыромятнический переулок, 1

Метро: Курская

Описание вакансии

Мы запустили новый продукт - LLM-платформу для наших клиентов из госсектора и enterprise-сегмента и развиваем его.
Сейчас мы усиливаем усиливаем продуктовую команду и ищем Ведущего инженера данных, который будет отвечать за организацию и подготовку данных для AI-решений (от подключения внешних источников и проектирования модели данных до подготовки данных для поиска и RAG).

КАКИЕ ЗАДАЧИ НЕОБХОДИМО РЕШАТЬ:
  • Определять источники данных для AI-решений: базы данных, документы, API, файловые хранилища, внешние системы и потоки обновлений
  • Проектировать модели данных: сущности и связи, версии, метаданные, lineage, права доступа и правила актуализации
  • Организовывать сбор и обработку данных из внешних источников: очистку, нормализацию, дедупликацию, классификацию и разметку
  • Формировать единое эталонное представление объекта (golden record) при объединении данных из нескольких источников
  • Подготавливать данные для поиска и RAG: chunking, embeddings, индексация, векторный и гибридный поиск
  • Настраивать retrieval и reranking, обеспечивать обновление индексов при изменении исходных данных
  • При необходимости готовить датасеты для обучения или дообучения моделей, если задача не решается с помощью RAG
  • Определять показатели качества данных и retrieval, организовывать их мониторинг: полнота, актуальность, precision/recall, latency и другие показатели
  • Взаимодействовать с LLM-инженерами, аналитиками и разработчиками при проектировании AI-решений


НАШИ ОЖИДАНИЯ:

  • От 4 лет опыта в Data Engineering, Data Platform, Data Architecture или смежной области
  • Уверенное знание SQL и реляционных баз данных
  • Опыт построения ETL/ELT-процессов и data pipelines
  • Опыт интеграции данных из различных источников: БД, API, файлов и внешних систем
  • Практический опыт проектирования моделей данных и работы с качеством данных, метаданными и версиями
  • Опыт работы с большими объёмами данных
  • Практический опыт подготовки данных для поиска, ML или LLM/RAG-систем
  • Понимание принципов chunking, embeddings, vector search и hybrid search
  • Опыт работы с векторными хранилищами или поисковыми системами
  • Умение самостоятельно разбираться в структуре и качестве новых источников данных

БУДЕТ ПЛЮСОМ:

  • Опыт разработки и эксплуатации RAG-систем в production
  • Опыт оптимизации retrieval и reranking
  • Python для обработки данных и разработки data pipelines
  • Kafka или другие системы потоковой обработки данных
  • Airflow или аналогичные инструменты оркестрации
  • PostgreSQL, ClickHouse, Elasticsearch/OpenSearch, векторные хранилища и аналогичные технологии
  • Опыт подготовки датасетов для supervised learning / fine-tuning
  • Понимание метрик оценки RAG: retrieval quality, groundedness, faithfulness, coverage
    ​​​​​​​
Навыки
  • SQL
  • ETL
  • Алгоритмы и структуры данных
  • Базы данных
  • Python
  • RAG
  • PostgreSQL
  • API
  • Работа с большим объемом информации
  • Data Platform
Посмотреть контакты работодателя

Адрес

Похожие вакансии

VK
  • Москва

  • Не указана

Рекомендуем
Проммикс
  • Москва

  • Не указана

Рекомендуем
WINLINE
  • Москва

  • Не указана

Рекомендуем
Neoflex
  • Москва

  • Не указана

Негосударственный Пенсионный Фонд Сбербанка

Data Engineer / ETL-разработчик

Негосударственный Пенсионный Фонд Сбербанка

  • Москва

  • Не указана

Альфа-Банк
  • Москва

  • Не указана

Зарубежнефть
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

Мокка
  • Москва

  • Не указана

МосТрансПроект

Data Engineer

МосТрансПроект

  • Москва

  • Не указана

Домклик
  • Москва

  • Не указана

Страховая компания Сбербанк страхование

Senior/Team Lead DS

Страховая компания Сбербанк страхование

  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию