Мы разрабатываем инновационное решение в области блокчейн-технологий — эффективную систему кодогенерации на новом языке программирования смарт-контрактов с использованием современных LLM-моделей. Наша архитектура построена на основе мультиагентного подхода: несколько AI-агентов взаимодействуют друг с другом, последовательно решая подзадачи от анализа требований до генерации, валидации и оптимизации кода.
Мы ищем Agent SRE, который обеспечит надежную, масштабируемую и наблюдаемую эксплуатацию этих агентов. Вам предстоит строить инфраструктуру надежности для ИИ-агента и RAG-систем: управлять их поведением, качеством, стоимостью и безопасностью.
Обязанности
- обеспечение надежности, масштабируемости и отказоустойчивости инфраструктуры для запуска агентных систем в Kubernetes
- управление CI/CD пайплайнами на базе Jenkins и BitBucket, внедрение GitOps-подходов с использованием Helm для декларативного управления релизами
- настройка систем мониторинга, логирования и трейсинга для инфраструктурных компонентов
- трейсинг агентов: внедрение трассировки цепочек рассуждений агентов, мониторинг их поведения и производительности. Интеграция с PGVector и Qdrant для отслеживания качества RAG-запросов и семантического поиска
- определение и мониторинг SLI — доля успешных генераций кода (success rate), точность (hallucination rate), время выполнения задачи, стоимость токенов
- тестирование и валидация агентов: разработка пайплайнов регрессионного тестирования агентов (evals), нагрузочное тестирование агентных систем
- внедрение "предохранителей" (circuit breakers) для защиты от каскадных отказов и автоматического ограничения нагрузки при сбоях агентов
- мониторинг поведения агентов для обнаружения аномалий и отклонений от штатного режима (rogue detection)
- разработка сценариев автономного восстановления агентов при типовых инцидентах без участия человека (self-healing)
- перевод инструкций и процедурных знаний (runbook'ов) в исполняемые сценарии для агентов с целью сокращения ручного труда (toil reduction)
- планирование работ, оценка задач, ведение документации.
Требования
- опыт в роли SRE/DevOps от 3 лет коммерческого опыта эксплуатации высоконагруженных распределенных систем
- глубокое понимание Kubernetes (архитектура, операторы, Custom Resources, Helm, сетевые политики), опыт эксплуатации кластеров в ПРОМе
- опыт с Jenkins (написание pipeline на Groovy), управление артефактами, интеграция с BitBucket (Git, PR, webhooks)
- продвинутый Python - опыт написания скриптов, инструментов автоматизации, API-клиентов, тестов
- опыт работы с PGVector и/или Qdrant (развертывание, настройка, оптимизация запросов, мониторинг производительности), с реляционными СУБД PostgreSQL
- опыт работы с Prometheus, Grafana, Loki, OpenTelemetry; умение строить SLO/SLI-дашборды и алерты
- уверенное владение Jira (ведение задач, эпиков, спринтов, фильтров, дашбордов)
- опыт написания юнит-тестов на Python (pytest), интеграционных тестов, опыт нагрузочного тестирования (k6, Locust, JMeter).
Будет плюсом
- опыт работы с ЦФА, блокчейнами, смарт-контрактами
- опыт с LLM и агентными фреймворками — понимание архитектуры RAG, работа с LangChain/LlamaIndex, знание особенностей LLM-провайдеров (OpenAI, Anthropic, DeepSeek)
- опыт работы с инструментами наблюдаемости для LLM — LangSmith, Weights & Biases, Arize
- опыт развертывания и оптимизации GPU-ворклоадов (vLLM, Triton, NVIDIA stack)
- опыт Chaos Engineering, опыт тестирования отказоустойчивости (Gremlin, Litmus).
Условия
- возможность выбрать удобный формат работы: гибрид или офис
- комфортный современный офис: Москва, пр. Кутузовский 32к1
- ежегодный пересмотр зарплаты, годовая премия
- корпоративный спортзал и зоны отдыха
- более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
- расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
- ипотека выгоднее до 7% для каждого сотрудника
- подписка Прайм с возможностью совместного использования на трёх близких
- вознаграждение за рекомендацию друзей в команду Сбера.