AI / LLM Inference Engineer

Ключевые ИТ Решения

AI / LLM Inference Engineer

Москва, Садовая-Каретная улица

Метро: Маяковская

Описание вакансии

ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.

Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.

Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.

Что предстоит делать:

  • запускать LLM и другие модели на GPU-инфраструктуре;
  • подбирать конфигурацию под модель, оборудование и профиль нагрузки;
  • работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями;
  • проводить бенчмарки и нагрузочное тестирование;
  • анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей;
  • разбираться с OOM, низкой производительностью и нестабильной работой моделей;
  • настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism;
  • участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками;
  • вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика.

Что для нас важно:

  • практический опыт запуска и оптимизации моделей на GPU;
  • опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом;
  • понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти;
  • опыт проведения бенчмарков и анализа производительности;
  • умение диагностировать OOM, низкую загрузку GPU и деградацию производительности;
  • уверенная работа с Linux, Docker и Python;
  • понимание архитектуры современных LLM;
  • умение анализировать проблему по логам, метрикам и результатам тестов.

Будет плюсом:

  • опыт запуска Qwen, Llama, Mistral или других открытых моделей;
  • знание CUDA и инструментов профилирования GPU;
  • опыт работы с Kubernetes и GPU-операторами;
  • понимание MIG, MPS и других механизмов распределения GPU-ресурсов;
  • опыт построения ML- или AI-платформ;
  • опыт работы с OpenStack;
  • опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling;
  • знание Prometheus, Grafana, GitLab CI, Terraform или Ansible.

Технологический контур:

OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.

Условия:

— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)

— бессрочный трудовой договор.

— бонусная система, включая проектные премии.

— ДМС, программы психологической поддержки.

— компания оплачивает обучение и сертификацию.

— преимущества работы в IT-компании.

Навыки
  • LLM Inference Engineer
  • GPU
Посмотреть контакты работодателя

Адрес

Похожие вакансии

  • Москва

  • Не указана

Рекомендуем
Дневник.ру

AI-инженер

Дневник.ру

  • Вьетнам

  • Не указана

Рекомендуем
СБЕР
  • Москва

  • Не указана

Рекомендуем
ИК СИБИНТЕК

Архитектор AI

ИК СИБИНТЕК

  • Москва

  • Не указана

Ингосстрах
  • Москва

  • Не указана

Битроботикс

Lead AI Engineer/AI Platform Engineer

Битроботикс

  • Москва

  • Не указана

ProBack
  • Москва

  • Не указана

СБЕР
  • Москва

  • Не указана

МТС

AI Tech Lead

МТС

  • Москва

  • Не указана

Платформа Третье Мнение

NLP-инженер

Платформа Третье Мнение

  • Москва

  • Не указана

MR Group, группа компаний

AI Engineer (ГПХ)

MR Group, группа компаний

  • Москва

  • Не указана

Витте Инновации
  • Москва

  • Не указана

Лемана ПРО
  • Москва

  • Не указана

АНО ЦИСМ
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию