Cowork.ru - платформа ИИ-агентов для бизнеса и государственных организаций. Мы запускаем языковые модели на собственной GPU-инфраструктуре и предлагаем как облачную, так и гибридную поставку, когда платформа работает у заказчика, а инференс идёт из нашего облака.
Нагрузка растёт, модели обновляются каждые несколько месяцев, а агентные сценарии требуют длинного контекста и быстрого ответа. Направление развития инференса у нас уже работает, и мы ищем руководителя, который возьмёт его под свою ответственность: от тюнинга и выбора моделей до экономики токена и плана мощностей. Направление работает в тесной связке с командой R&D Сбера.
Чем предстоит заниматься:
- Управлять парком GPU-серверов: распределять мощности между моделями и продуктами, планировать резервы мощности, формулировать требования к новому оборудованию для команды инфраструктуры.
- Прогнозировать потребность в мощностях по бизнес-метрикам и планам продаж и заранее выходить с обоснованными предложениями по расширению парка.
- Регулярно оценивать новые модели и принимать решение о переходе, сопоставляя качество на наших задачах, скорость, выдерживаемую нагрузку и стоимость.
- Повышать эффективность инференса: снижать стоимость токена и ускорять ответы за счёт настройки движков и методов оптимизации.
- Следить за новыми технологиями ускорения и специализированными моделями, проверять их на нашей нагрузке и внедрять то, что даёт результат.
- Вместе с командой SRE поддерживать сквозные метрики инференса (скорость ответа, утилизация, удерживаемая нагрузка, стоимость токена) и участвовать в разборе инцидентов.
- Совместно с командой R&D Сбера синхронизировать планы исследований и переносить их результаты в продакшен.
- Развивать и усиливать команду, отвечать за бюджет направления и регулярно отчитываться руководству по себестоимости, утилизации и прогнозу.
Что мы ожидаем:
- От 5 лет в инфраструктуре, SRE или ML-платформах, из них от 2 лет вы отвечали за продакшен-инференс LLM на собственных GPU-серверах.
- Опыт руководства командой или направлением: найм, планирование, бюджет.
- Вы обосновывали потребность в расширении GPU-мощностей цифрами нагрузки и экономики.
- Вы запускали и оптимизировали LLM в продакшене (vLLM, SGLang, TensorRT-LLM или аналоги) и можете рассказать о результатах в цифрах.
- Выбирали модели для продакшена и принимали решения о переходе на новые, сравнивая качество, скорость, нагрузку и стоимость.
- Хорошо ориентируетесь в современном GPU-железе NVIDIA и понимаете, как его характеристики влияют на скорость и стоимость инференса.
- Умеете связывать технические решения с бизнес-метриками и объяснять их руководству и финансам.
- Умеете выстраивать работу со смежными командами (SRE, продукт, исследователи): договариваться о зонах ответственности и общих метриках.
Будет плюсом:
- Опыт сервинга моделей разных архитектур, плотных и MoE, в том числе на длинном контексте.
- Опыт с ускорителями не только NVIDIA.
- Опыт построения оценки моделей на собственных задачах.
- Выступления, статьи, вклад в open source проекты инференса.
Что мы предлагаем:
- Ключевая роль в действующем направлении: вы развиваете архитектуру, процессы и команду и определяете, куда двигать инференс дальше.
- Работа с современным GPU-железом и самыми свежими открытыми моделями, бюджет на эксперименты.
- Прямое влияние на продукт и экономику компании: ваши решения видны в стоимости токена и скорости ответа для каждого пользователя.
- Совместная работа с командой R&D Сбера.
- Высокий уровень дохода.
- Формат работы и локация: офис или гибрид, по договорённости.
- ДМС с первого месяца работы.
- Работа в аккредитованной IT компании.
- Льготная ипотека от Сбера.
- Локация: Москва, м. Цветной бульвар.