ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.
Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.
Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.
Что предстоит делать:
- запускать LLM и другие модели на GPU-инфраструктуре;
- подбирать конфигурацию под модель, оборудование и профиль нагрузки;
- работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями;
- проводить бенчмарки и нагрузочное тестирование;
- анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей;
- разбираться с OOM, низкой производительностью и нестабильной работой моделей;
- настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism;
- участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками;
- вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика.
Что для нас важно:
- практический опыт запуска и оптимизации моделей на GPU;
- опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом;
- понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти;
- опыт проведения бенчмарков и анализа производительности;
- умение диагностировать OOM, низкую загрузку GPU и деградацию производительности;
- уверенная работа с Linux, Docker и Python;
- понимание архитектуры современных LLM;
- умение анализировать проблему по логам, метрикам и результатам тестов.
Будет плюсом:
- опыт запуска Qwen, Llama, Mistral или других открытых моделей;
- знание CUDA и инструментов профилирования GPU;
- опыт работы с Kubernetes и GPU-операторами;
- понимание MIG, MPS и других механизмов распределения GPU-ресурсов;
- опыт построения ML- или AI-платформ;
- опыт работы с OpenStack;
- опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling;
- знание Prometheus, Grafana, GitLab CI, Terraform или Ansible.
Технологический контур:
OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.
Условия:
— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)
— бессрочный трудовой договор.
— бонусная система, включая проектные премии.
— ДМС, программы психологической поддержки.
— компания оплачивает обучение и сертификацию.
— преимущества работы в IT-компании.