OneCell — российская MedTech компания. Мы хотим, чтоб каждый человек мог быстро и без лишних трат получить диагноз по онкологии, а также второе мнение. Чтобы обеспечить это мы единственные в стране разработали собственный цифровой гистологический сканер и AI-платформу для патоморфологической диагностики (основной инструмент для совместной работы патологов, клиницистов и радиологов).
Почему мы ищем человека:
Расширение команды ItOps.
Работа делится примерно пополам: половина — поток обращений от коллег, половина — инциденты внутреннего контура и инфраструктурные проекты.
С кем предстоит работать
- ItOps: руководитель отдела и сисадмин.
- DevOps: делают IaC-шаблоны, пайплайны и стандарты, которые мы применяем. К ним же эскалируем, если дефект в самом инструменте.
- Эксплуатация: клиентские окружения. С ними пересекаемся на каналах связи до площадок заказчиков.
- Информационная безопасность: формулирует политики, мы их реализуем во внутреннем контуре.
Чем предстоит заниматься:
- Разбирать инциденты внутреннего контура. Примеры: не поднимается прод, упал сервер, не отвечает сервис, не собирается образ микросервиса. Около четырёх инцидентов повышенного приоритета в неделю. Необходимо найти причину и исправить.
- Инфраструктурные проекты — разрабатывать, внедрять и поддерживать инфраструктурные решения внутреннего контура.
- Разворачивать и обновлять dev/staging-среды в Kubernetes по шаблонам DevOps.
- Закрывать поток обращений — около 4–5 в день: доступы и учётные записи к корпоративным системам.
- Вести онбординг и оффбординг сотрудников под ключ от ноутбука и учёток до полного закрытия доступов при уходе.
- Развивать корпоративную сеть и VPN: Site to site между дата-центрами, каналы до площадок заказчиков, DNS, маршрутизация, сегментация.
- Настроить резервное копирование и восстановление ключевых систем с проведённым тестовым восстановлением.
- Проводить плановые обновления корп-сервисов в окна обслуживания с preflight-бэкапом, проверкой и планом отката.
- Писать runbook'и и снимать системные причины заявок. Если один и тот же тип обращений повторяется, задача не в том, чтобы закрывать его быстрее, а чтобы он перестал приходить.
Наш стек:
- Kubernetes (managed и bare-metal), ArgoCD, Helm, Ansible, GitLab CI, Proxmox VE, PostgreSQL/Patroni,
- Ceph / Longhorn / LVM / MinIO, Prometheus / Grafana / Alertmanager / blackbox,
- Vector / Kafka / ELK, Unbound, nginx (L4/L7), Keycloak.
Необходимые знания, навыки и опыт:
- Linux в продакшене от 3 лет: самостоятельно разбираешься, почему сервис не поднялся — systemd, логи, диски и inodes, права, сеть. Уверенный bash.
- Kubernetes на уровне эксплуатации и диагностики: читаешь события и логи, понимаешь Pending / CrashLoopBackOff / OOMKilled / ImagePullBackOff, PVC и StorageClass, ingress, requests/limits.
- Сети: маршрутизация, NAT, iptables, DNS, TLS, MTU. Умеешь доказать, где рвётся связность (tcpdump, ss, traceroute).
- GitLab CI как рабочий инструмент: читаешь пайплайн, находишь причину падения джобы, понимаешь раннеры и registry.
- Prometheus/Grafana: напишешь PromQL-запрос и правило алерта.
- Опыт работы в ServiceDesk-процессе: приоритеты, SLA.
- Умение управлять сложностью: перед изменением в проде выясняешь, как устроен компонент, и решаешь, как проверить гипотезу. Решение принимаешь сам и можешь объяснить, почему оно верное.
Будет преимуществом:
- Ansible и Terraform, ArgoCD/Helm и GitOps.
- Proxmox или другой гипервизор, работа с bare-metal.
- PostgreSQL/Patroni, в том числе операторы.
- Ceph, Longhorn, MinIO.
- Vector, Kafka, ELK.
- Keycloak, LDAP, OIDC.
- Bind/Unbound, nginx как L4-балансировщик.
- Работа с LLM-инструментами в ежедневном процессе.
Чем заниматься НЕ будешь:
- Не проектируешь IaC-шаблоны, стандарты развёртывания и архитектуру инфраструктуры — это зона команды DevOps. Мы их применяем и имеем право ставить им требования.
- Не работаешь с клиентскими окружениями и не поддерживаешь внешних клиентов — это Эксплуатация.
- Не пишешь политики информационной безопасности — реализуешь их.
Что мы предлагаем
- Cвой bare-metal Kubernetes, гипервизоры, физические сети между дата-центрами и каналы до площадок заказчиков.
- Прямое влияние на то, как устроена инфраструктура: тут есть что чинить, и решения принимаются быстро.