ML-инженер — RAG, LLM / VLM

Моделирование и цифровые двойники

ML-инженер — RAG, LLM / VLM

Москва, улица Викторенко, 5с1

Метро: Аэропорт

Описание вакансии

ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»

Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.

О проекте

«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.

Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.

Чем предстоит заниматься

Свой RAG:

- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.

- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.

- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.

Развитие VLM:

- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.

- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.

- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.

Инференс и on-prem-развертывание:

- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.

- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.

- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.

Общее:

- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.

- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.

Что мы ждём

- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.

- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.

- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).

- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.

- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».

- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.

Будет плюсом

- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.

- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.

- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).

- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.

- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.

- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).

Мы предлагаем:

• Работу в высококомпетентной компании в команде профессионалов;

• Интересные масштабные проекты в промышленности;

• Трудоустройство в строгом соответствии с ТК РФ;

• Стабильную достойную официальную заработную плату + систему мотивации;

• Обучение и сертификацию сотрудников;

• Перспективы профессионального и карьерного роста;

• Современный комфортный офис класса А.

Посмотреть контакты работодателя

Адрес

Похожие вакансии

USETECH
  • Москва

  • Не указана

Рекомендуем
СберЗдоровье

ML Engineer (NLP)

СберЗдоровье

  • Москва

  • Не указана

Рекомендуем
  • Москва

  • Не указана

Рекомендуем
КИТТ
  • Москва

  • Не указана

HeadHunter
  • Москва

  • Не указана

АНО ЦИСМ
  • Москва

  • Не указана

СберМедИИ

Data Scientist LLM (Middle)

СберМедИИ

  • Москва

  • Не указана

YADRO
  • Москва

  • Не указана

TOM TAILOR
  • Москва

  • Не указана

ПК Марка
  • Москва

  • до 350000 RUR

  • Москва

  • до 350000 RUR

NLP Data Scientist Преподаватель NLP/LLM

Низов Александр Сергеевич

  • Москва

  • до 350000 RUR

МТС
  • Москва

  • до 350000 RUR

FunCorp
  • Москва

  • до 350000 RUR

Selecty
  • Москва

  • до 350000 RUR

СБЕР
  • Москва

  • до 350000 RUR

Оператор информационной системы

ML-Engineer

Оператор информационной системы

  • Москва

  • до 350000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию