AI Agent Reliability Engineer / Harness Engineer Agentic AI

AI Agent Reliability Engineer / Harness Engineer Agentic AI

Описание вакансии

О продукте и стеке

Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком.​​​​​

Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API.

У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий.

Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness.


Что предстоит делать

Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов.
Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения.
Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости.
Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы.
Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий.
Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость.
Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев.


Первые 90 дней

Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон.

Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency.

Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества.


Обязательные требования

По каждому пункту на интервью спросим детали и артефакты.

  • Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог).
  • Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы. Использование готового чужого harness'а без проектирования собственного не засчитывается.
  • Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев.
  • Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы. Без этого evals превращаются в театр — спросим об этом отдельно.
  • Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости.
  • Английский B1 или выше.


Будет преимуществом

  • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами.
  • LLM-as-a-judge пайплайны с проверкой качества самой оценки.
  • Red teaming LLM-систем, AI security, построение guardrails.
  • Симуляторы, генераторы тестовых данных, собственные evaluators.
  • OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis.


Условия

  • Полная занятость, удалённая работа. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.
  • Возможность определять стандарты качества и надёжности агентной платформы.
  • Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.

Как откликнуться

Вместо стандартного сопроводительного письма:

  • Разберите одну AI- или backend-систему, надёжность которой вы повысили: как работала, за что отвечали лично вы, что реализовали, как изменились качество и стабильность. Приложите верифицируемые артефакты: GitHub, пример спроектированного eval-набора или evaluator'а, технические статьи.
  • Ответьте на вопрос: как вы построите eval для многошагового агента, у которого успех задачи не сводится к сравнению вывода с эталоном? Как проверите, что LLM-as-judge оценивает верно?
  • Опишите, что в этом проекте не получилось и почему.

Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.

Навыки
  • Python
  • LLM
  • AI Agents
  • Автоматизация процессов
  • Pytest
  • CI/CD
  • Docker
  • Backend-разработка
  • Observability
  • Английский язык
Посмотреть контакты работодателя

Похожие вакансии

  • Астана

  • от 100000 RUR

Рекомендуем
ЭПАМ Системз

Senior Platform Engineer

ЭПАМ Системз

  • Астана

  • от 100000 RUR

Рекомендуем
Itransition
  • Астана

  • от 100000 RUR

Рекомендуем
Epam Kazakhstan (Эпам Казахстан),ТОО

Senior / Lead AI Python Engineer

Epam Kazakhstan (Эпам Казахстан),ТОО

  • Астана

  • от 100000 RUR

SecOps-инженер

Сорвачева Дарья

  • Астана

  • от 100000 RUR

AI Artist

CONCEPT VIBE LTD

  • Астана

  • от 100000 RUR

Epam Kazakhstan (Эпам Казахстан),ТОО

Senior AI Engineer

Epam Kazakhstan (Эпам Казахстан),ТОО

  • Астана

  • от 100000 RUR

  • Астана

  • от 100000 RUR

Epam Kazakhstan (Эпам Казахстан),ТОО

Senior Test Automation Engineer

Epam Kazakhstan (Эпам Казахстан),ТОО

  • Астана

  • от 100000 RUR

BTS Digital
  • Астана

  • от 100000 RUR

Freedom Telecom Operations

Старший DevOps инженер

Freedom Telecom Operations

  • Астана

  • от 100000 RUR

  • Астана

  • до 900000 KZT

  • Астана

  • до 700000 KZT

Playrix
  • Астана

  • до 700000 KZT

Хотите оставить вакансию?

Заполните форму и найдите сотрудника всего за несколько минут.
Оставить вакансию