Чем предстоит заниматься
Проектирование и аудит инфраструктуры:
- Провести технический аудит существующего HPC-пилота и разрозненных вычислительных серверов.
- Описать текущую архитектуру, конфигурации, технический долг и основные эксплуатационные риски.
- Спроектировать целевую архитектуру инфраструктурного слоя HPC-контура.
- Определить стандарты для CPU- и GPU-серверов, сетевого оборудования, систем хранения и системного программного обеспечения.
- Прорабатывать конфигурации новых вычислительных узлов и готовить технические требования к оборудованию.
- Участвовать в выборе, приемке, настройке и вводе оборудования в эксплуатацию.
Управление кластером и распределение ресурсов:
- Развивать и сопровождать Slurm-кластер.
- Настраивать очереди, разделы, приоритеты, квоты, учет пользователей и распределение ресурсов.
Сопровождение, мониторинг и интеграция:
- Стандартизировать Linux-окружения, драйверы, CUDA/ROCm, библиотеки и контейнерные среды.
- Автоматизировать установку операционных систем, подключение новых узлов и управление конфигурациями.
- Организовать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm.
- Обеспечить резервное копирование критических конфигураций и возможность восстановления инфраструктуры.
- Анализировать загрузку CPU-, GPU-, сетевых и storage-ресурсов.
- Выявлять узкие места и готовить предложения по масштабированию инфраструктуры.
- Обеспечивать техническую интеграцию HPC-контура с разрабатываемой вычислительной платформой.
- Совместно с платформенной командой определять интерфейсы между Slurm, серверами, хранилищами и пользовательскими сервисами.
- Помогать внутренним командам переносить вычислительные нагрузки в общий HPC-контур.
- Разбирать сложные проблемы производительности и эксплуатации.
Платформенные интерфейсы и доступ пользователей:
- Помогать в проектировании и создании API-слоя и облачных интерфейсов как единой точки взаимодействия между кластером Slurm и пользователями/продуктовыми командами.
- Интегрировать API-слой с внутренними сервисами платформы для единого жизненного цикла задач.
Процессы, документация и техническое лидерство:
- Выстроить процессы управления изменениями, реагирования на инциденты и анализа причин сбоев.
- Поддерживать техническую документацию по архитектуре, конфигурациям и процедурам.
- Участвовать в найме и развитии инженеров HPC-инфраструктуры.
- Проводить технические ревью и контролировать качество инфраструктурных изменений.
- На первом этапе лично участвовать в реализации ключевых технических решений.
Что мы ожидаем
Ключевой опыт и стек:
- Сильный практический опыт администрирования Linux.
- Опыт проектирования и эксплуатации HPC-кластеров.
- Практический опыт работы со Slurm или другим планировщиком вычислительных задач.
- Глубокое понимание серверного оборудования и архитектуры CPU- и GPU-систем.
- Опыт работы с физическими серверами: установка, диагностика, настройка, обновление прошивок и тестирование компонентов.
- Понимание принципов построения сетевой инфраструктуры и систем хранения.
- Опыт эксплуатации GPU-стека, включая драйверы, CUDA или ROCm.
- Опыт автоматизации инфраструктуры с использованием Ansible или аналогичных инструментов.
- Опыт построения мониторинга, логирования и оповещений.
- Понимание контейнерных технологий и воспроизводимых вычислительных окружений.
Компетенции и подход:
- Способность находить причины проблем на уровнях оборудования, ОС, сети, драйверов, Slurm и пользовательской нагрузки.
- Умение принимать технические решения и самостоятельно доводить их до работающего результата.
- Готовность сочетать архитектурную работу с непосредственной инженерной реализацией.
- Умение взаимодействовать с разработчиками, исследователями, инженерами, поставщиками и внутренними пользователями.
- Опыт или понимание принципов создания API-брокеров/шлюзов между планировщиками задач и пользовательскими интерфейсами.
Будет преимуществом:
- Опыт создания инфраструктурной основы для внутреннего облака или вычислительной платформы.
- Опыт эксплуатации Kubernetes, OpenStack или других систем управления инфраструктурой.
- Опыт работы с высокоскоростными сетями, включая InfiniBand или RoCE.
- Опыт эксплуатации распределенных и параллельных файловых систем.
- Опыт работы с крупными GPU-контурами.
- Опыт автоматизированной установки серверов по сети.
- Знание MPI, NCCL и основных библиотек высокопроизводительных вычислений.
- Понимание задач машинного обучения, численного моделирования или инженерных расчетов.
- Опыт профилирования и оптимизации вычислительных приложений.
- Опыт технического руководства небольшой командой инженеров.
- Практический опыт разработки API (REST/gRPC) на Python/Go/Java и интеграции с SLURM через python-scheduler, srun API или аналоги.
Мы предлагаем:
- Работу в аккредитованной ИТ-компании.
- Шаг в космос - для тех, кто вдохновлен идеей покорения космоса и мечтает быть к этому причастным.
- Возможность выбора формата работы в Москве (офис/гибрид).
- Комфортный современный офис рядом с метро "Мнёвники".
- Оформление в соответствии с ТК РФ.
- Конкурентный уровень заработной платы - на уровне лидеров ИТ/телеком-индустрии.