Мы — продуктовая компания, развиваем cowork.ru — корпоративную AI-платформу: агентный ассистент с подключаемыми инструментами (MCP), отложенными задачами, базами знаний и каталогом навыков. Ищем инженера в AI-команду: мы делаем экспериментальные фичи для продукта, быстрые PoC для B2B-заказчиков на базе платформы, standalone-решения и R&D — от агентских бенчмарков до вопросов инференса на собственных GPU.
Обязанности:
- Разрабатывать агентные системы: tool use / function calling, многошаговое планирование, human-in-the-loop
- Проектировать и подключать MCP-серверы: превращать внешние системы и данные в инструменты агентов
- Быстро собирать PoC и MVP под заказчиков на базе платформы (сжатые сроки, живые демо)
- Делать экспериментальные фичи для продукта и отдельные standalone-решения
- Итеративно улучшать компоненты агентной системы — системные промпты, скилы, инструменты — опираясь на метрики и разбор траекторий (в том числе прогоны на нашем открытом агентском бенчмарке)
- Тестировать и внедрять модели разных модальностей: текст, vision/OCR, ASR
- Работать с базами знаний: RAG-пайплайны, гибридный поиск, обработка документов
- Контейнеризировать и деплоить решения, в том числе on-prem
Требования: - Опыт работы 1–3 года, есть реальные LLM-проекты (агенты, ассистенты, RAG)
- Python (asyncio, FastAPI), Git, Docker / docker-compose
- Уверенная работа с LLM API: OpenAI-compatible интерфейсы, function calling, structured output, стриминг
- Опыт работы с большими моделями разных семейств (Qwen, DeepSeek, GigaChat, GPT/Claude/Gemini)
- Понимание архитектуры LLM на прикладном уровне: трансформеры, MoE, контекстное окно и его ограничения, узкие места инференса
- Понимание MCP (Model Context Protocol): устройство протокола, опыт создания или подключения серверов
- RAG как один из навыков: chunking, embeddings, гибридный поиск (BM25 + dense), reranking
- PostgreSQL, Redis
- Оценка качества: eval-пайплайны, метрики, разбор трейсов агентов
- Способность объяснить принятые технические решения и их trade-offs
Будет плюсом:
- Опыт разворачивания инференса на GPU: vLLM / SGLang, multi-GPU конфигурации, квантизация (FP8/INT8)
- Агентные фреймворки и SDK: Strands Agents, OpenAI Agents SDK, LangGraph, CAMEL
- Durable execution: Restate, Temporal
- Observability и трейсинг: Langfuse, OpenTelemetry
- Мультимодальные модели: VLM (Qwen-VL и др.), OCR-пайплайны, ASR (Whisper и аналоги)
- Фронтенд-навыки: собрать демо на React/TypeScript и показать решение
- Опыт с LiteLLM или другими model-роутерами
Условия: -
Достойная заработная плата + годовой бонус
-
Сильная команда
-
ДМС с первого месяца работы
-
Работа в аккредитованной IT компании
-
Льготная ипотека от Сбера
-
Локация: Москва, м. Цветной бульвар.