Мы разрабатываем флагманский продукт компании YADRO – TATLIN.UNIFIED. Это современное хранилище данных (СХД), созданное для решения задач традиционных корпоративных приложений, больших данных и аналитики. Продукт развертывается в ЦОД, публичных и частных облаках, сочетая высокую надежность, масштабируемость и простоту эксплуатации.
Команда L4 осуществляет сопровождение продукта со стороны отдела разработки. Мы отвечаем за решение комплексных задач на стыке разработки и эксплуатации, развитие диагностических инструментов и упрощение сопровождения продукта.
Обязанности:
- Поддержка платформенных сервисов на базе Linux (механизмы инициализации и обновления системы, управление службами, сетевая подсистема, управление кластером) и управляющей подсистемы;
- Проведение расследований инцидентов, анализ отказов, поиск корневых причин (RCA);
- Исправление ошибок, поступающих от Заказчиков и сервисных команд. Выпуск хотфиксов и срочных исправлений;
- Разработка скриптов автоматизации, диагностических утилит и мониторинга;
- Развитие механизмов обновления и инсталляции, оптимизация сервисных процедур;
- Платформенная отладка: анализ поведения Linux (ядро, сервисы, syscalls, память, сеть);
- Экспертная поддержка: консультирование L3, документирование RCA, менторство, улучшение ремонтопригодности системы.
Требования: - Уверенное знание Linux: внутреннее устройство, syscalls, управление памятью, процессы/потоки, базовые сервисы, файловые системы, инструменты отладки, работа с ядром и модулями;
- Владение Go и/или настойчивое желание глубоко развиваться в этом языке;
- Понимание особенностей работы многопоточного и конкурентного кода;
- Знание базовых алгоритмов и структур данных, принципов организации и обработки данных в памяти/на диске;
- Знание сетей и протоколов передачи данных (TCP/IP, маршрутизация, QoS, диагностика сетевого стека);
- Владение Python и Bash для написания скриптов автоматизации, диагностики и взаимодействия с инфраструктурой;
- Способность самостоятельно разбираться в новых областях, умение быстро погружаться в чужой код и работать с большой кодовой базой и кросс-зависимостями;
- Готовность к дежурствам с фокусом на анализ, профилактику и улучшение процессов, а не только на оперативное восстановление.
Будет плюсом, если вы: - Владеете языком C;
- Имеете опыт работы с ETCD, Clusterlabs Pacemaker, Docker, NATS;
- Знакомы с особенностями серверного оборудования и аппаратными; подсистемами: CPU/RAM, NVMe/SATA/SCSI, RAID/HBA, BMC/IPMI, PCIe, interconnects (RDMA/FCoE/Ethernet);
- Знакомы с протоколами SCSI / NVMe;
- Имеете представление об iSCSI / Fibre Channel;
- Работали с диагностическими инструментами глубокого анализа.