Senior DevOps-инженер (сети и высоконагруженная инфраструктура)

ИнтеллектДиалог

Senior DevOps-инженер (сети и высоконагруженная инфраструктура)

Описание вакансии

В IntellectDialog ищем Senior DevOps / Strong Middle+ инженера с реальным опытом работы с production-инфраструктурой.

Нам нужен инженер, который не просто умеет развернуть Docker, написать pipeline или поднять VPN по инструкции, а понимает инфраструктуру целиком: Linux, сети, маршрутизацию, контейнеры, базы данных, отказоустойчивость и прохождение трафика между сервисами. Специалист, который способен не только поддерживать уже работающую инфраструктуру, но и проектировать её, находить слабые места и предлагать технически обоснованные решения.

Формат работы: удалённо, частичная / дополнительная занятость, гибкий график.
Оплата: 6 000 тенге в час.
В перспективе возможно обсуждение доли в компании.

Что у нас за инфраструктура

У нас распределённая архитектура с большим количеством сервисов и существенным объёмом сетевого трафика.

В работе приходится решать задачи, связанные с:

  • контейнеризацией и оркестрацией;
  • высокой доступностью сервисов;
  • горизонтальным масштабированием;
  • эксплуатацией stateful-компонентов;
  • CI/CD;
  • мониторингом и observability;
  • сетевой связностью между сервисами и инфраструктурными сегментами;
  • проксированием и управлением маршрутами трафика;
  • построением VPN-сетей;
  • эксплуатацией инфраструктуры, где необходимо понимать не только отдельный сервис, но и полный путь прохождения трафика через систему.

Поэтому нам нужен человек, который уже самостоятельно решал подобные задачи в production и способен принимать инфраструктурные решения, а не только выполнять готовые инструкции.

Отдельное внимание уделяем сетевому опыту.

Ожидаем уверенное понимание L3/L4 networking и практический опыт построения сложных схем маршрутизации трафика.

Будет важно, если вы самостоятельно проектировали и эксплуатировали:

  • сложные таблицы и правила маршрутизации;
  • policy-based routing / source-based routing;
  • разделение разных типов и потоков трафика по различным маршрутам и uplink'ам;
  • управление ingress/egress traffic;
  • NAT/SNAT/DNAT;
  • маршрутизацию между несколькими сетями, подсетями, VPN и инфраструктурными сегментами;
  • site-to-site и point-to-site VPN;
  • WireGuard / OpenVPN / IPsec или аналогичные технологии;
  • split tunneling и selective routing;
  • проксирование TCP/HTTP(S) трафика;
  • forward/reverse proxy;
  • цепочки proxy и несколько уровней проксирования;
  • балансировку и распределение трафика между backend-сервисами;
  • HAProxy / Nginx и аналогичные решения;
  • DNS и его влияние на маршрутизацию и доступность сервисов;
  • Linux networking: routing tables, ip rule, ip route, network namespaces;
  • iptables/nftables;
  • диагностику packet loss, latency, MTU/MSS, asymmetric routing, connection tracking и проблем сетевой связности.

Особенно интересен опыт, когда необходимо было разделять несколько потоков трафика и динамически или политиками направлять их через разные VPN, proxy, интерфейсы, шлюзы или внешние каналы.

Важно не просто знать названия технологий, а понимать, почему пакет пошёл по конкретному маршруту, где возникает bottleneck и как будет вести себя схема при отказе одного из узлов или каналов.

Основной технологический стек

Нужен production-опыт с существенной частью следующего стека:

  • Docker;
  • Docker Swarm — clustering, overlay networking, HA;
  • GitLab CI/CD;
  • Redis;
  • Memcached;
  • MongoDB;
  • MySQL;
  • ClickHouse;
  • MinIO;
  • Grafana;
  • Zabbix;
  • Linux.

По базам данных ожидаем понимание эксплуатации, а не только подключения приложения к БД:

  • replication;
  • backup/restore;
  • PITR;
  • failover;
  • восстановление после аварий;
  • диагностика проблем производительности и доступности.

Что предстоит делать

  • Развивать и поддерживать production-инфраструктуру.
  • Проектировать инфраструктурные и сетевые решения.
  • Настраивать и оптимизировать маршрутизацию разных потоков трафика.
  • Строить и поддерживать VPN- и proxy-инфраструктуру.
  • Диагностировать сетевые проблемы на уровне Linux/network stack.
  • Развивать Docker Swarm-кластеры и обеспечивать их отказоустойчивость.
  • Оптимизировать CI/CD и deployment-процессы.
  • Работать с разработчиками при проектировании и запуске новых сервисов.
  • Настраивать monitoring, alerting и централизованное логирование.
  • Разбирать production-инциденты и находить root cause, а не ограничиваться рестартом сервиса.
  • Повышать reliability и availability системы.
  • Автоматизировать инфраструктурные операции.
  • Проектировать решения с учётом отказов отдельных серверов, сетей, каналов и сервисов.

Что ожидаем от кандидата

  • 3+ года коммерческого опыта DevOps / SRE / Infrastructure Engineer либо сопоставимый по глубине production-опыт.
  • Уверенная работа с Linux.
  • Глубокое понимание Docker и контейнерных сетей.
  • Практический опыт Docker Swarm или сопоставимых систем оркестрации.
  • Сильное понимание TCP/IP, routing, NAT, DNS, VPN и proxy.
  • Практический опыт построения нестандартных схем маршрутизации.
  • Опыт эксплуатации MongoDB / MySQL и других stateful-сервисов.
  • Опыт построения backup/recovery и failover-механизмов.
  • Опыт мониторинга и диагностики production-систем.
  • Понимание принципов построения fault-tolerant и distributed systems.
  • Способность самостоятельно разбираться в проблеме от уровня приложения до контейнера, ОС, сети и инфраструктуры.

Большим плюсом будет опыт эксплуатации highload / high-traffic инфраструктуры, где сетевые и архитектурные ошибки напрямую влияют на доступность сервиса.

Кого мы ищем

Нам будет особенно интересно поговорить, если вы уже сталкивались с ситуациями, когда:

  • падение одного компонента могло повлиять на значительную часть production;
  • необходимо было искать причину проблемы одновременно в приложении, контейнере, Linux и сети;
  • приходилось проектировать маршрутизацию нескольких независимых потоков трафика;
  • трафик необходимо было направлять через разные VPN/proxy/gateway в зависимости от источника, назначения или типа трафика;
  • требовалось обеспечить HA не только приложения, но и сетевого контура;
  • приходилось разбирать реальные production-инциденты под нагрузкой;
  • вы проектировали инфраструктуру с пониманием failure scenarios, а не только happy path.

Мы ценим инженеров, которые могут не только ответить «как это настроить», но и объяснить «почему архитектура должна быть устроена именно так, где она сломается и что произойдёт при отказе каждого компонента».

Что написать при отклике

Пожалуйста, не ограничивайтесь отправкой резюме. Нам важно сразу понять ваш реальный технический уровень.

В сопроводительном сообщении ответьте на несколько вопросов:

1. С какой самой сложной production-инфраструктурой вы работали?
Коротко опишите масштаб: количество серверов/сервисов, примерную нагрузку и за что конкретно отвечали лично вы.

2. Какую сложную сетевую задачу вы решали самостоятельно?
Например: несколько VPN, несколько шлюзов, разделение трафика, сложная маршрутизация, прокси, NAT.

Важно описать не просто используемые технологии, а примерно так:

«Было X → требовалось добиться Y → я спроектировал Z → в результате получили …»

3. Приходилось ли вам направлять разные потоки трафика по разным маршрутам?
Если да — коротко опишите схему и по какому принципу выбирался маршрут.

4. Расскажите об одном серьёзном инциденте в production.
Что сломалось, как вы диагностировали проблему, в чём оказалась причина и что сделали, чтобы ситуация не повторилась.

5. С какими базами данных работали в production?
Что именно настраивали самостоятельно: репликацию, резервное копирование, PITR, автоматическое переключение, восстановление после аварий.

6. Какой у вас практический опыт Docker / Docker Swarm?
Интересует именно эксплуатация кластеров, сети, обновления, отказоустойчивость и реальные проблемы, которые приходилось решать.

7. Если есть опыт ML / LLM — коротко опишите его.
JupyterHub, MLflow, Spark, Ray, DVC, GPU, развёртывание и эксплуатация LLM и т. д.

8. И обязательно подтвердите условия:
Подходит ли вам удалённая частичная занятость с почасовой оплатой 6 000 тенге в час?

Нам не нужен длинный текст. Достаточно нескольких конкретных примеров из вашего опыта.

По ответам должно быть понятно что именно вы делали своими руками, а не только какие технологии были перечислены в стеке компании.

Ждём в команде IntellectDialog.

Посмотреть контакты работодателя

Похожие вакансии

Частная Компания S1LK PAY Ltd
  • Алматы

  • Не указана

Рекомендуем
Alma Innovation
  • Алматы

  • до 850000 KZT

Рекомендуем

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию