Мы развиваем внутреннюю корпоративную платформу для запуска open-weight LLM и агентных решений на собственной GPU-инфраструктуре.
Ищем опытного инженера, готового работать на стыке эксплуатации LLM, распределённых систем, платформенной архитектуры и быстро развивающихся агентных технологий.
Мы не ожидаем, что один человек будет одинаково глубоко разбираться во всех перечисленных областях. Важно иметь сильную экспертизу как минимум в двух-трёх направлениях и быть готовым погружаться в смежные задачи.
Чем предстоит заниматься:
- Следить за развитием open-weight LLM, систем инференса, coding agents и AI-инфраструктуры; находить перспективные технологии и оценивать их готовность к внедрению.
- Тестировать и сравнивать модели на GPU-серверах по качеству, скорости, задержкам, пропускной способности, нагрузке, потреблению памяти, сложности эксплуатации и стоимости инференса.
- Переводить успешные прототипы в надёжные промышленные решения, повышать производительность, отказоустойчивость и наблюдаемость платформы.
- Проектировать внутреннюю AI-платформу: LLM-роутер, механизмы маршрутизации, балансировки и управления нагрузкой, приоритизации, квотирования, кэширования, выбора моделей и graceful degradation.
- Разрабатывать агентов, MCP-серверы, скиллы, интеграции с агентными фреймворками, системы оценки качества и другие платформенные компоненты.
- Формировать архитектурные и инженерные стандарты для безопасности, разграничения прав, версионирования, тестирования, публикации, аудита и сопровождения компонентов AI-платформы.
- Взаимодействовать с внутренними пользователями и инженерными командами, превращая их потребности в работающие платформенные решения.
- Использовать coding agents и другие AI-инструменты для ускорения разработки, исследований, тестирования и подготовки документации, отвечая за качество результата.
Основные требования:
- Сильная инженерная база и опыт проектирования промышленных программных систем.
- Опыт работы с LLM, ML-инфраструктурой, распределёнными системами, высокопроизводительными вычислениями или сопоставимыми по сложности технологиями.
- Понимание ключевых аспектов LLM-инференса: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация, параллелизм и KV-кэш.
- Опыт эксплуатации Linux-сервисов, контейнеров, систем мониторинга и современных практик развёртывания.
- Понимание принципов распределённых систем: маршрутизация, балансировка, backpressure, admission control, retries, тайм-ауты, планирование ресурсов и отказоустойчивость.
- Умение проектировать API, границы сервисов, потоки данных и эксплуатационные интерфейсы.
- Уверенное владение хотя бы одним универсальным языком программирования; Python будет преимуществом.
- Навыки диагностики проблем производительности и надёжности на уровнях приложения, инфраструктуры, ОС, сети и GPU.
- Опыт создания сопровождаемых систем с автоматизированным тестированием, code review, документацией, мониторингом и контролируемым выпуском изменений.
- Практический опыт работы с coding agents или другими LLM-инструментами разработки: декомпозиция задач, подготовка контекста, проверка кода, тестирование, отладка и валидация результата.
Будет преимуществом опыт:
- Промышленного запуска open-weight LLM на SGLang, vLLM, TensorRT-LLM, TGI или аналогичных решениях.
- Эксплуатации крупных dense- и MoE-моделей на многопроцессорных GPU-системах; понимание tensor, pipeline, data, expert и sequence parallelism.
- Опыт применения квантизации, speculative decoding, prefix caching, многоуровневого KV-cache и disaggregated inference.
- Проектирования или эксплуатации OpenAI-совместимых API, потоковой генерации, structured output, tool calling, reasoning-моделей и продолжительных агентных сценариев.
- Разработки маршрутизации между моделями, cache-aware routing, динамического выбора моделей, квот, приоритетов и управления многопользовательской нагрузкой.
- Оценки coding-моделей, coding agents, tool-use и многошаговых агентных сценариев.
- Разработки агентов, агентных рантаймов, MCP-клиентов и серверов, workflow-движков, портируемых скиллов и интеграций с агентными фреймворками.
- Обеспечения безопасности агентных систем: управление учётными данными и правами, sandboxing, изоляция данных, approval flows, аудит и безопасность цепочки поставки.
- Внедрения решений в крупных корпоративных или изолированных средах с повышенными требованиями к безопасности, соответствию регламентам, идентификации пользователей и сетевому доступу.
- Опыт работы с Kubernetes, Docker Compose, Docker Swarm, Prometheus, Grafana, OpenTelemetry или аналогичными технологиями.
- Участия в open-source-проектах, публикация технических материалов, создание публичных бенчмарков или разработка внутренних платформенных решений.
Что для нас важно:
- Инженерное мышление и независимость от конкретных фреймворков, вендоров и стеков.
- Принятие решений на основе измерений, экспериментов и проверяемых данных.
- Интерес к новым технологиям в сочетании со здоровым скептицизмом.
- Умение быстро создавать прототипы и переводить успешные решения в надёжную промышленную эксплуатацию.
- Понимание, что AI-платформа включает не только запуск моделей, но и API, маршрутизацию, безопасность, доступы, governance, developer experience, оценку качества, мониторинг и эксплуатацию.
- Готовность переключаться между исследованиями, архитектурой, разработкой, оптимизацией и решением производственных проблем.
- Умение работать в команде, делиться знаниями и формировать общие инженерные практики.
Что мы предлагаем:
- Сплоченную команду профессионалов, в которой можно не только успешно реализовывать проекты, но и перенимать опыт и развиваться.
- Обучение, участие в интересных проектах и расширение профессиональной экспертизы: мы участвуем в конференциях, митапах, публикуемся на Хабр и т.д.
- Конструктивную и открытую рабочую атмосферу.
- Полис добровольного медицинского страхования, обслуживаемый в лучших клиниках, а также чек-ап для сотрудников 40+.
- Страхование жизни, страхование от несчастных случаев и критических заболеваний, страхование выезжающих за рубеж.
- Материальную помощь.
- Детские подарки.
- Доплату по листу нетрудоспособности.
- Корпоративные скидки на товары и услуги от партнеров компании.
- Служебную сотовую связь.
- Кафетерий льгот — возможность самостоятельно выбрать дополнительные корпоративные льготы и бонусы (спорт, здоровье, обучение, путешествия, транспорт и др.). Доступно после испытательного срока.
- Формат работы удалённый на территории РФ. Работа по московскому часовому поясу.