Санкт-Петербург, Московский проспект, 94
Метро: Московские воротаЧто нужно делать:
Оптимизировать инференс локальных LLM и внутренних моделей (квантизация, батчинг, KV-cache, маршрутизация запросов) с помощью vLLM, Triton и аналогов
Выжимать максимум из текущего парка серверов: перераспределять ресурсы GPU/CPU/VRAM между задачами и внедрять решения для роста производительности без лишних затрат
Разрабатывать кастомные метрики утилизации и настраивать мониторинг нагрузки серверов (очереди, задержки, ошибки, пропускная способность)
Организовать прозрачный учет GPU-ресурсов компании и обеспечить отказоустойчивость инфраструктуры
Планировать закупки железа: анализировать потребности бизнеса, формировать технические требования и подбирать оптимальные конфигурации GPU-серверов
Необходимый опыт и знания:
Что мы предлагаем:
Москва
Не указана