Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.
Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.
Сразу о главном: мы не обучаем веса моделей. Fine-tuning и post-training не входят в роль — опыт с ними приветствуется, но не является ядром. Ядро роли — превращать описание работы и опыт предметных экспертов в систему знаний, навыков, инструкций и критериев решений, по которой агент устойчиво выполняет профессиональную роль на готовой агентской архитектуре. Уровень Middle/Senior в разработке нужен, чтобы понимать устройство системы, работать с её кодом и отличать пробел в обучении от ограничения модели, инструментов или архитектуры.
Граница со смежной ролью: инфраструктура оценки — оценочный harness, evals-платформа, release gates — зона Reliability / Harness Engineer. Вы отвечаете за содержание: доменные знания, правила решений, обучающие и оценочные наборы — и работаете внутри готового оценочного harness.
Формализовать профессиональную роль вместе с предметными экспертами: задачи, критерии решений, исключения, полномочия и условия эскалации.
Настраивать агента в рамках готовой архитектуры: навыки, структура знаний, инструкции, примеры, правила использования инструментов.
Формировать обучающий и оценочный набор из реальных кейсов, экспертных исправлений и спроектированных граничных сценариев.
Анализировать трассы выполнения, классифицировать причины ошибок и последовательно корректировать обучающие материалы или конфигурацию агента.
Определять критерии готовности роли, проводить evals и регрессионные проверки, версионировать изменения и доводить агента до устойчивого результата.
Формализовать первую профессиональную роль вместе с предметным экспертом: задачи, критерии решений, исключения, условия эскалации.
Собрать обучающий и оценочный набор из реальных кейсов и граничных сценариев; довести агента до устойчивого прохождения evals по этой роли.
Задокументировать методику как переиспользуемый стандарт обучения ролей для платформы.
По каждому пункту на интервью спросим детали и артефакты.
Вместо стандартного сопроводительного письма:
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
Копылов Евгений Анатольевич
Москва
от 100000 RUR
Цифровые технологии и платформы
Москва
от 100000 RUR
Москва
от 100000 RUR
Общественный Фонд Центр Социальных Инклюзивных Программ
Москва
от 100000 RUR
Багерстат Рус
Балашиха (Московская область)
от 100000 RUR