Orion soft — российский разработчик ИТ-продуктов, в основу которых заложена концепция программно-определяемого ЦОД.
Наша цель — сделать работу с AI-инфраструктурой удобной и предсказуемой: от подготовки окружения и выделения GPU до запуска моделей, масштабирования и мониторинга.
Ищем системного инженера, который поможет развивать платформу: исследовать технологии, проверять архитектурные гипотезы и доводить решения до готовности к включению в продукт. Ты будешь работать вместе с разработчиками, архитекторами и QA и влиять на то, как устроена Nova AI.
Твои задачи:
- Проводить R&D в области AI/ML-инфраструктуры: сравнивать open source решения, собирать прототипы, оценивать ограничения и предлагать варианты интеграции в платформу;
- Интегрировать и адаптировать компоненты для рабочих сред ML-инженеров, ML-пайплайнов, хранения и версионирования моделей, запуска инференса;
- Прорабатывать сценарии обычного и распределённого инференса: развёртывание моделей, масштабирование, сетевое взаимодействие и эффективное использование вычислительных ресурсов;
- Автоматизировать сборку, установку, настройку и обновление компонентов платформы с помощью CI/CD, Helm и инструментов управления конфигурацией;
- Создавать тестовые стенды, проводить нагрузочные испытания и проверки отказоустойчивости, находить причины проблем на уровне ОС, Kubernetes, сетей, хранилищ и AI/ML-компонентов;
- Развивать мониторинг и диагностику платформы: метрики GPU и сервисов, логи, оповещения и инструменты поиска узких мест;
- Совместно с командой устранять уязвимости, проверять совместимость обновлений и готовить компоненты к выпуску;
- Документировать решения, ограничения и рекомендации; создавать воспроизводимые примеры и инструкции для пользователей и команды поддержки.
Что нужно, чтобы попасть в команду:
- От трёх лет опыта системным, DevOps- или платформенным инженером;
- Уверенное владение Linux;
- Практический опыт работы с Kubernetes;
- Знание основ TCP/IP, DNS, HTTP(S), TLS и балансировки нагрузки;
- Умение автоматизировать задачи, работать с Git и CI/CD;
- Опыт настройки мониторинга и логирования, например с Prometheus и Grafana;
- Понимание инфраструктурных потребностей AI/ML: чем обучение отличается от инференса, для чего нужны GPU, хранилища моделей и рабочие окружения;
- Умение самостоятельно разобраться в новой технологии, проверить её на практике и аргументированно представить результаты команде. Английский — на уровне чтения технической документации.
Будет серьёзным преимуществом (плюсом):
- Разворачивал AI/ML-сервисы в Kubernetes и работал с MLflow, JupyterHub, Airflow, Kubeflow или аналогичными инструментами;
- Запускал модели через vLLM, Triton Inference Server, KServe, Ray или другие инструменты инференса;
- Работал с GPU-инфраструктурой: драйверами, CUDA, GPU Operator, разделением GPU и планировщиками задач;
- Знаком с распределёнными вычислениями и высокоскоростными сетями, включая InfiniBand и RDMA;
- Работал с S3-совместимыми хранилищами, PostgreSQL, векторными базами данных или системами хранения ML-артефактов;
- Понимаешь инфраструктуру RAG-систем, AI-шлюзов и агентных приложений;
- Знаком с безопасностью контейнеров, сканированием зависимостей и эксплуатацией ПО в изолированных контурах.