Timeweb Cloud — это облако, которое не стоит на месте. Мы создаем масштабную экосистему ИТ-сервисов — от надежной базовой инфраструктуры (IaaS) до готовых PaaS- и SaaS-решений, включая инновационные AI-технологии.
Продукт сложный и технически интересный, мы растем вдвое быстрее рынка, а наши ребята — лучшие эксперты в своих областях.
Сейчас мы ищем в нашу команду системного администратора, который будет заниматься нетиповыми конфигурациями серверов, расследовать сложные инциденты и автоматизировать всё, что движется.
Фокус роли — инфраструктура облака: виртуализация, сеть (overlay/underlay), производительность, инциденты уровня платформы.
Мы предлагаем нашей команде:
Твое решение реально меняет продукт. Задачи со звёздочкой: нестандартные сценарии, новейшее железо и технологии, плюс возможность работать на стыке направлений. Скучно не будет.
Свобода и баланс
-
Можешь работать гибридно или удаленно из любой страны мира (но по московскому времени);
-
Если работаешь удаленно – оплатим билеты в Петербург на наши запоминающиеся корпоративы;
-
Каждый квартал дарим два дополнительных оплачиваемых выходных.
Забота и здоровье
-
Мы IT аккредитованы и оформляем официально;
-
ДМС, компенсация спорта, питания и психолога;
-
Бонусные средства на личный аккаунт Timeweb Cloud для пет-проектов.
Рост и культура
-
Карьерный рост здесь не ждёт твоего запроса – мы замечаем людей и даем пространство для развития;
-
Можешь выступать на конференциях и делиться экспертизой публично – это приветствуется;
-
Внутри компании: участвуем в забегах, устраиваем кибертурниры, собираемся клубом настолок и не только!
Чем предстоит заниматься:
1. Расследование сложных проблем
- Анализировать логи, трейсы и метрики, чтобы находить корневые причины инцидентов в любой части облака;
- Диагностировать проблемы на уровне Python-сервисов и скриптов (достаточно понимания кода, активная разработка не требуется);
- Работать с ядром Linux, сетевым стеком для поиска узких мест.
2. Проектирование и установка нетиповых конфигураций
- Разворачивать распределённые системы в проде и на живой нагрузке;
- Оптимизировать производительность хостов виртуализации и сетевых dataplane-компонентов (NUMA, IRQ/RPS, I/O, планировщики);
- Участвовать в архитектурном проектировании новых решений вместе с командой.
3. Автоматизация
- Писать скрипты на Bash и Python для автоматизации установки ПО и конфигурации серверов;
- Работать с системами управления конфигурациями (SaltStack / Ansible);
- Настраивать и развивать мониторинг (Zabbix и другие системы).
4. Oncall и эскалации
- Участвовать в дежурствах (примерно неделя в месяц, oncall);
- Подключаться к решению аварийных ситуаций, когда штатные средства и младшие команды не справляются.
Мы ожидаем: - Глубокое понимание работы Linux: cgroups, namespaces, сетевой стек, systemd, процессы и система инициализации;
- Понимание топологии процессоров, включая NUMA, и умение учитывать это при настройке производительности;
- Умение расследовать проблемы на уровне ядра и системных вызовов: от анализа логов и strace до поиска узких мест;
- Опыт работы с QEMU/KVM и libvirt;
- Понимание различий между виртуальными машинами и контейнерами;
- Понимание VLAN, VXLAN, BGP;
- Опыт работы с OpenvSwitch, понимание OpenFlow;
- Опыт работы с SaltStack и/или Ansible;
- Настройка и поддержка мониторинга (Zabbix или аналоги);
- Уверенное владение Bash.
Будет плюсом: - Базовое понимание Ceph: что это такое, как на нём строятся S3 и RBD-диски для виртуалок;
- Опыт работы с SAN/NAS;
- Опыт работы с OpenStack / OpenNebula / oVirt;
- Знакомство с SDN-решениями (OVN, Tungsten Fabric).
Наш стек:
- ОС и виртуализация: Linux (ядро, systemd), QEMU/KVM, libvirt;
- Сети: VLAN, VXLAN, BGP, OpenvSwitch, OpenFlow, FRR;
- Автоматизация: SaltStack, Ansible, Bash, Python (скриптинг);
- Мониторинг: Zabbix, Prometheus/Node Exporter, Victoria Metrics;
- Хранилища: базовое взаимодействие с Ceph;
- CI/CD: GitLab CI/CD.
Для быстрой связи укажите @ своего Телеграма в сопроводительном письме ☺️