Тбилиси
-AI / LLM-инфраструктура — основное направление
-Развёртывать, настраивать и поддерживать self-hosted LLM.
-Работать с GPU-серверами и оптимизировать использование GPU/VRAM.
-Запускать и сопровождать inference-сервисы на базе vLLM, llama.cpp и других инструментов.
-Настраивать и диагностировать NVIDIA Drivers, CUDA, NCCL и Docker GPU.
-Работать с Multi-GPU-конфигурациями.
-Развёртывать AI-агентов и agentic workflows.
-Интегрировать LLM и AI-агентов с внутренними сервисами компании.
-Участвовать в автоматизации процессов с использованием AI.
Инфраструктура:
-Администрировать Linux, Proxmox VE, Docker и LXC.
-Поддерживать серверную и GPU-инфраструктуру.
-Настраивать и развивать мониторинг: Zabbix, Grafana, Prometheus.
-Диагностировать и устранять инфраструктурные и сетевые инциденты.
-Работать с VPN, Firewall, VLAN, маршрутизацией и управлением доступами.
Участвовать в организации резервного копирования и Disaster Recovery:
-Автоматизация
-Автоматизировать развёртывание и настройку серверов и сервисов.
-Использовать Ansible, Terraform и другие инструменты автоматизации.
-Снижать количество ручных операций и повышать стабильность инфраструктуры.
Дополнительно:
-Помогать команде разработки с инфраструктурными задачами.
-Участвовать в настройке окружений и CI/CD.
-Работать совместно с разработчиками, DevOps, QA и NOC.
Вакансия размещена на перспективу.