Мы запустили новый продукт - LLM-платформу для наших клиентов из госсектора и enterprise-сегмента и развиваем его.
Сейчас мы усиливаем усиливаем продуктовую команду и ищем
Ведущего инженера данных, который будет отвечать за организацию и подготовку данных для AI-решений (от подключения внешних источников и проектирования модели данных до подготовки данных для поиска и RAG).
КАКИЕ ЗАДАЧИ НЕОБХОДИМО РЕШАТЬ: - Определять источники данных для AI-решений: базы данных, документы, API, файловые хранилища, внешние системы и потоки обновлений
- Проектировать модели данных: сущности и связи, версии, метаданные, lineage, права доступа и правила актуализации
- Организовывать сбор и обработку данных из внешних источников: очистку, нормализацию, дедупликацию, классификацию и разметку
- Формировать единое эталонное представление объекта (golden record) при объединении данных из нескольких источников
- Подготавливать данные для поиска и RAG: chunking, embeddings, индексация, векторный и гибридный поиск
- Настраивать retrieval и reranking, обеспечивать обновление индексов при изменении исходных данных
- При необходимости готовить датасеты для обучения или дообучения моделей, если задача не решается с помощью RAG
- Определять показатели качества данных и retrieval, организовывать их мониторинг: полнота, актуальность, precision/recall, latency и другие показатели
- Взаимодействовать с LLM-инженерами, аналитиками и разработчиками при проектировании AI-решений
НАШИ ОЖИДАНИЯ:
- От 4 лет опыта в Data Engineering, Data Platform, Data Architecture или смежной области
- Уверенное знание SQL и реляционных баз данных
- Опыт построения ETL/ELT-процессов и data pipelines
- Опыт интеграции данных из различных источников: БД, API, файлов и внешних систем
- Практический опыт проектирования моделей данных и работы с качеством данных, метаданными и версиями
- Опыт работы с большими объёмами данных
- Практический опыт подготовки данных для поиска, ML или LLM/RAG-систем
- Понимание принципов chunking, embeddings, vector search и hybrid search
- Опыт работы с векторными хранилищами или поисковыми системами
- Умение самостоятельно разбираться в структуре и качестве новых источников данных
БУДЕТ ПЛЮСОМ:
- Опыт разработки и эксплуатации RAG-систем в production
- Опыт оптимизации retrieval и reranking
- Python для обработки данных и разработки data pipelines
- Kafka или другие системы потоковой обработки данных
- Airflow или аналогичные инструменты оркестрации
- PostgreSQL, ClickHouse, Elasticsearch/OpenSearch, векторные хранилища и аналогичные технологии
- Опыт подготовки датасетов для supervised learning / fine-tuning
- Понимание метрик оценки RAG: retrieval quality, groundedness, faithfulness, coverage