DevOps / MLOps Engineer (LLM Infrastructure)

DevOps / MLOps Engineer (LLM Infrastructure)

Москва, Осенний бульвар

Метро: Молодежная

Описание вакансии

О продукте и роли

Мы создаём B2B-платформу автономных ИИ-агентов для рынка США и ищем инженера, который возьмёт на себя инфраструктурный контур LLM-платформы: стабильное и безопасное развёртывание, масштабирование, наблюдаемость и стоимость AI-сервисов. Разработка ML-моделей и исследовательские эксперименты не являются ядром роли.

Что предстоит делать

Обслуживать облачную инфраструктуру компании. Поддерживать виртуальные машины, кластеры, сети и хранилища у облачных провайдеров: обновления и патчи, управление образами и конфигурациями, резервное копирование и проверка восстановления, контроль расходов на облако, планирование ресурсов под рост нагрузки.

Сопровождать инфраструктуру на стороне клиентов. Разворачивать и поддерживать сервисы в контуре заказчика: согласование доступов и регламентов, удалённая диагностика, обновления без простоя, мониторинг состояния, техническая документация для команды клиента.

Администрировать рабочие среды команды. Поддерживать защищённый удалённый доступ к средам разработки и внутренним сервисам, единые конфигурации и политики, защиту рабочих данных и централизованный контроль состояния.

Вести учётные записи и доступы. Поддерживать единую точку входа и многофакторную аутентификацию, управлять ролями и группами по принципу минимальных привилегий, выдавать и вовремя отзывать доступы к репозиториям, облакам, базам данных и внутренним сервисам, регулярно пересматривать права, вести реестр и журналирование, закрывать все доступы сотрудника в день увольнения.

Автоматизировать поставку сервисов и моделей. Строить CI/CD и GitOps-процессы, управлять инфраструктурой как кодом, обеспечивать воспроизводимые релизы, canary- и blue-green-развёртывания, rollback и disaster recovery. Давать разработчикам единый способ запускать, тестировать и выпускать LLM- и агентные сервисы без ручной настройки инфраструктуры.

Эксплуатировать LLM-сервисы. Поддерживать интеграции с managed-моделями и, при необходимости, inference-сервисы для open-source моделей. Настраивать маршрутизацию запросов, квоты, rate limits, retry, fallback и безопасное переключение между моделями и провайдерами.

Обеспечивать производительность и экономику inference. Контролировать latency, throughput, доступность, использование токенов и стоимость. Для self-hosted моделей — управлять GPU-ресурсами, планированием нагрузки, autoscaling, batching и кэшированием.

Строить наблюдаемость LLM-платформы. Метрики, логи и распределённая трассировка запросов; мониторинг версий моделей и конфигураций, ошибок провайдеров, расхода токенов и деградации производительности. Настраивать алерты и понятные дашборды для инженерной команды.

Обеспечивать надёжность и безопасность. Участвовать в on-call, расследовать инциденты, проводить RCA и postmortem, создавать runbooks и устранять системные причины повторных сбоев. Управлять секретами, настраивать сетевую изоляцию, шифрование, аудит действий и безопасную работу с пользовательскими данными.

Обязательные требования

  • 3+ лет опыта в DevOps/MLOps и практический опыт развёртывания или поддержки LLM- или GenAI-сервисов.
  • Опыт работы в крупной компании или с высоконагруженными промышленными системами: сможете описать масштаб, собственную зону ответственности, инциденты и принятые архитектурные решения.
  • Администрирование Linux в облачной среде: образы, конфигурации, обновления без простоя, резервное копирование и проверенное восстановление.
  • Уверенная эксплуатация Kubernetes в production: Helm, управление ресурсами, autoscaling, persistent storage, networking и безопасные обновления.
  • Практический опыт CI/CD и GitOps, infrastructure as code и автоматизации: GitLab CI, GitHub Actions или аналоги; Argo CD; Terraform и Ansible или сопоставимые инструменты.
  • Практический опыт одного или обоих контуров LLM-инфраструктуры: эксплуатация managed LLM API с маршрутизацией, квотами, retry и fallback; развёртывание open-source моделей через vLLM, TGI, Triton, Ollama или аналоги.
  • Наблюдаемость production-систем: метрики, логи, трассировка, алерты; контроль доступности, latency, throughput, ошибок и стоимости LLM-запросов.
  • Опыт обеспечения надёжности: on-call, расследование инцидентов, RCA и runbooks.
  • Управление доступами: SSO и провайдер идентификации (Google Workspace, Entra ID, Keycloak, Okta или аналоги), MFA, RBAC, отлаженные процессы onboarding и offboarding.
  • Организация защищённого удалённого доступа: VPN или Zero Trust, бастион-хосты, управление ключами и сертификатами.
  • Готовность к сервисным задачам: поддержка коллег и клиентов, работа по заявкам, соблюдение сроков реакции.
  • Python и Bash на уровне автоматизации инфраструктуры и диагностики production-сервисов.
  • Английский B1 или выше: чтение документации и рабочее взаимодействие с техническими командами.

Будет преимуществом

  • Эксплуатация GPU-кластеров: NVIDIA GPU Operator или device plugin, квоты, scheduling, autoscaling, мониторинг загрузки и capacity planning.
  • Оптимизация inference: batching, caching, quantization, управление latency, throughput и стоимостью.
  • RAG-инфраструктура, векторные хранилища и пайплайны данных: pgvector, Qdrant, Milvus, S3 или аналоги.
  • Langfuse, LangSmith, Arize Phoenix или другие инструменты трассировки и наблюдаемости LLM-приложений.
  • MLflow, Kubeflow, Ray, KServe или другие компоненты жизненного цикла и serving ML-моделей.
  • Опыт развёртывания решений в инфраструктуре корпоративных клиентов или в регулируемой среде.
  • Построение процессов управления доступом с нуля: регламенты, реестр, регулярный пересмотр прав.
  • Управление стоимостью облака: тегирование ресурсов, бюджеты, оптимизация потребления.
  • Прохождение аудита безопасности или соответствия требованиям заказчика (SOC 2, ISO 27001 или аналог).

Условия

  • Полная занятость, работа в офисе (Москва), возможна удаленка.
  • Возможность определять инфраструктурные стандарты LLM-платформы с ранней стадии.
  • Высокая самостоятельность в выборе инженерных решений; оценка по надёжности, скорости выпуска и стоимости эксплуатации.
  • Сложные задачи на стыке DevOps, MLOps, облачной инфраструктуры и production AI.

Как откликнуться

Вместо стандартного сопроводительного письма:

  1. Расскажите об одном LLM- или GenAI-сервисе, который вы лично довели до production или поддерживали после запуска: для кого он был создан, как был устроен, каков был масштаб и за что отвечали лично вы.
  2. Опишите самый сложный инфраструктурный инцидент в этом проекте: как он проявился, как вы нашли причину, что изменили и как проверили результат.
  3. Расскажите, какое первоначальное решение в этом проекте не сработало, почему и чем вы его заменили. Если возможно, приложите подтверждающие материалы: GitHub, архитектурную схему, техническую статью или публичный разбор.

Отклики из общих формулировок без конкретного production-опыта не рассматриваются.

Навыки
  • DevOps
  • MLOps
  • Linux
  • Kubernetes
  • Docker
  • Python
  • Grafana
  • ELK
  • AWS
  • LLM
  • Английский язык
Посмотреть контакты работодателя

Адрес

Похожие вакансии

ИЦ АЙ-ТЕКО

Devops в AI HUB

ИЦ АЙ-ТЕКО

  • Москва

  • до 220000 RUR

Рекомендуем
КАТЮША ПРИНТ

Младший DevOps в офис

КАТЮША ПРИНТ

  • Москва

  • до 180000 RUR

Рекомендуем
РТК-ЦОД

DevOps-инженер

РТК-ЦОД

  • Москва

  • до 180000 RUR

Рекомендуем
МКК Займ-Экспресс
  • Москва

  • до 180000 RUR

Автономные Технологии

DevOps-инженер

Автономные Технологии

  • Москва

  • до 180000 RUR

Городской Центр Бронирования и Туризма

DevOps-инженер

Городской Центр Бронирования и Туризма

  • Москва

  • до 200000 RUR

Цитадель
  • Москва

  • до 200000 RUR

Swordfish Security
  • Москва

  • до 200000 RUR

САТЕЛ, Группа компаний

DevOps-инженер (Проект до 31.03.2027)

САТЕЛ, Группа компаний

  • Москва

  • до 200000 RUR

585, Холдинг

DevOps/инженер Linux

585, Холдинг

  • Москва

  • до 200000 RUR

ГАРДА ТЕХ СОЛЮШНС ГРУПП

Инженер внедрения

ГАРДА ТЕХ СОЛЮШНС ГРУПП

  • Москва

  • до 200000 RUR

Норникель
  • Москва

  • до 200000 RUR

НОРСИ-ТРАНС

Infrastructure Security Engineer

НОРСИ-ТРАНС

  • Москва

  • до 200000 RUR

Московский метрополитен
  • Москва

  • до 200000 RUR

Rambler&Co
  • Москва

  • до 200000 RUR

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию