Москва, Центральный административный округ, район Хамовники, квартал Красная Роза
Инференс LLM в масштабе — это сложная инфраструктурная задача: GPU работают на пределе, возникают сетевые задержки, возможны сбои оборудования. Мы создаём решения, чтобы эти события минимально влияли на доступность и latency нашего сервиса инференса.
Какие задачи вас ждут:
Оптимизация инференсных движков
Вам предстоит повышать эффективность и снижать latency при выполнении LLM-инференса на GPU.
Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на стабильность и скорость инференса.
Исследование и внедрение
Вам предстоит работать с методами оптимизации инференса (квантованием, прунингом) и современными подходами к параллелизации
Федеральное автономное учреждение Государственный Научно-Исследовательский Институт Авиационных Систем
Москва
Не указана