Ведущий инженер вычислительного кластера

БЮРО 1440

Ведущий инженер вычислительного кластера

Москва, Большая кольцевая линия, метро Мнёвники

Метро: Мнёвники

Описание вакансии

Чем предстоит заниматься

Проектирование и аудит инфраструктуры:

  • Провести технический аудит существующего HPC-пилота и разрозненных вычислительных серверов.
  • Описать текущую архитектуру, конфигурации, технический долг и основные эксплуатационные риски.
  • Спроектировать целевую архитектуру инфраструктурного слоя HPC-контура.
  • Определить стандарты для CPU- и GPU-серверов, сетевого оборудования, систем хранения и системного программного обеспечения.
  • Прорабатывать конфигурации новых вычислительных узлов и готовить технические требования к оборудованию.
  • Участвовать в выборе, приемке, настройке и вводе оборудования в эксплуатацию.

Управление кластером и распределение ресурсов:

  • Развивать и сопровождать Slurm-кластер.
  • Настраивать очереди, разделы, приоритеты, квоты, учет пользователей и распределение ресурсов.

Сопровождение, мониторинг и интеграция:

  • Стандартизировать Linux-окружения, драйверы, CUDA/ROCm, библиотеки и контейнерные среды.
  • Автоматизировать установку операционных систем, подключение новых узлов и управление конфигурациями.
  • Организовать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm.
  • Обеспечить резервное копирование критических конфигураций и возможность восстановления инфраструктуры.
  • Анализировать загрузку CPU-, GPU-, сетевых и storage-ресурсов.
  • Выявлять узкие места и готовить предложения по масштабированию инфраструктуры.
  • Обеспечивать техническую интеграцию HPC-контура с разрабатываемой вычислительной платформой.
  • Совместно с платформенной командой определять интерфейсы между Slurm, серверами, хранилищами и пользовательскими сервисами.
  • Помогать внутренним командам переносить вычислительные нагрузки в общий HPC-контур.
  • Разбирать сложные проблемы производительности и эксплуатации.

Платформенные интерфейсы и доступ пользователей:

  • Помогать в проектировании и создании API-слоя и облачных интерфейсов как единой точки взаимодействия между кластером Slurm и пользователями/продуктовыми командами.
  • Интегрировать API-слой с внутренними сервисами платформы для единого жизненного цикла задач.

Процессы, документация и техническое лидерство:

  • Выстроить процессы управления изменениями, реагирования на инциденты и анализа причин сбоев.
  • Поддерживать техническую документацию по архитектуре, конфигурациям и процедурам.
  • Участвовать в найме и развитии инженеров HPC-инфраструктуры.
  • Проводить технические ревью и контролировать качество инфраструктурных изменений.
  • На первом этапе лично участвовать в реализации ключевых технических решений.

Что мы ожидаем

Ключевой опыт и стек:

  • Сильный практический опыт администрирования Linux.
  • Опыт проектирования и эксплуатации HPC-кластеров.
  • Практический опыт работы со Slurm или другим планировщиком вычислительных задач.
  • Глубокое понимание серверного оборудования и архитектуры CPU- и GPU-систем.
  • Опыт работы с физическими серверами: установка, диагностика, настройка, обновление прошивок и тестирование компонентов.
  • Понимание принципов построения сетевой инфраструктуры и систем хранения.
  • Опыт эксплуатации GPU-стека, включая драйверы, CUDA или ROCm.
  • Опыт автоматизации инфраструктуры с использованием Ansible или аналогичных инструментов.
  • Опыт построения мониторинга, логирования и оповещений.
  • Понимание контейнерных технологий и воспроизводимых вычислительных окружений.

Компетенции и подход:

  • Способность находить причины проблем на уровнях оборудования, ОС, сети, драйверов, Slurm и пользовательской нагрузки.
  • Умение принимать технические решения и самостоятельно доводить их до работающего результата.
  • Готовность сочетать архитектурную работу с непосредственной инженерной реализацией.
  • Умение взаимодействовать с разработчиками, исследователями, инженерами, поставщиками и внутренними пользователями.
  • Опыт или понимание принципов создания API-брокеров/шлюзов между планировщиками задач и пользовательскими интерфейсами.

Будет преимуществом:

  • Опыт создания инфраструктурной основы для внутреннего облака или вычислительной платформы.
  • Опыт эксплуатации Kubernetes, OpenStack или других систем управления инфраструктурой.
  • Опыт работы с высокоскоростными сетями, включая InfiniBand или RoCE.
  • Опыт эксплуатации распределенных и параллельных файловых систем.
  • Опыт работы с крупными GPU-контурами.
  • Опыт автоматизированной установки серверов по сети.
  • Знание MPI, NCCL и основных библиотек высокопроизводительных вычислений.
  • Понимание задач машинного обучения, численного моделирования или инженерных расчетов.
  • Опыт профилирования и оптимизации вычислительных приложений.
  • Опыт технического руководства небольшой командой инженеров.
  • Практический опыт разработки API (REST/gRPC) на Python/Go/Java и интеграции с SLURM через python-scheduler, srun API или аналоги.

Мы предлагаем:

  • Работу в аккредитованной ИТ-компании.
  • Шаг в космос - для тех, кто вдохновлен идеей покорения космоса и мечтает быть к этому причастным.
  • Возможность выбора формата работы в Москве (офис/гибрид).
  • Комфортный современный офис рядом с метро "Мнёвники".
  • Оформление в соответствии с ТК РФ.
  • Конкурентный уровень заработной платы - на уровне лидеров ИТ/телеком-индустрии.
Посмотреть контакты работодателя

Адрес

Похожие вакансии

ЕВРОФИНАНС МОСНАРБАНК, АКБ
  • Москва

  • Не указана

Рекомендуем
Национальная система платежных карт

Ведущий инженер по виртуализации

Национальная система платежных карт

  • Москва

  • Не указана

Рекомендуем
Группа компаний Астра

Инженер внедрения (ALD Pro)

Группа компаний Астра

  • Москва

  • Не указана

Рекомендуем
  • Москва

  • Не указана

ТЕЛЕРУС
  • Москва

  • Не указана

YADRO
  • Москва

  • Не указана

Гознак
  • Москва

  • Не указана

ШИНСЕРВИС

Senior DevOps-инженер

ШИНСЕРВИС

  • Москва

  • Не указана

Плати по миру

DevSecOps-инженер (fintech)

Плати по миру

  • Москва

  • Не указана

Absolut POS
  • Москва

  • Не указана

БиАйЭй-Технолоджиз

AI Infrastructure Engineer

БиАйЭй-Технолоджиз

  • Москва

  • Не указана

Цифровой аудит
  • Москва

  • Не указана

Независимая нефтегазовая компания

Главный системный администратор

Независимая нефтегазовая компания

  • Москва

  • Не указана

ЕВРАЗ
  • Москва

  • Не указана

Лига Цифровой Экономики

Инженер 3 линии поддержки

Лига Цифровой Экономики

  • Москва

  • Не указана

РДП Энтерпрайз

Tech Lead (PCEF)

РДП Энтерпрайз

  • Москва

  • Не указана

Smart Engines
  • Москва

  • Не указана

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию