Мы — Alventa.ai, делаем AI-голосового администратора для стоматологических клиник. Агент сам принимает звонки пациентов, консультирует, записывает на приём, переносит и отменяет визиты. Он говорит по-русски в реальном времени и ведёт диалог по сценариям, заданным в состояниях.
Ищем QA-инженера, который выстроит системное тестирование агента и замкнёт цикл «нашли баг → разметили данные → дообучили модель → проверили, что баг закрыт». Тестировать нужно не форму на сайте, а живой диалог, который каждый раз идёт немного по-разному.
Чем предстоит заниматься
- Строить тестовую модель агента: сценарии звонков (запись, перенос, отмена, консультация, продажа услуги), состояния и переходы между ними, граничные и нестандартные случаи
- Писать и поддерживать тест-кейсы и чек-листы, собирать регрессионные наборы
- Прогонять сценарии: звонить агенту вручную и запускать текстовые прогоны. Проверять перебивания, уход от темы, неполные ответы, шум, фамилии, телефоны, даты и время
- Учитывать недетерминированность LLM: гонять кейс несколько раз, считать долю успешных прогонов, отделять стабильные баги от случайных
- Заводить баги с чёткой классификацией: ошибка распознавания речи, неверный переход по сценарию, неправильно извлечённые данные, галлюцинация, грамматика, тон и стиль, синтез речи
- Анализировать логи реальных звонков, находить повторяющиеся проблемы и превращать их в тест-кейсы
- Размечать и исправлять датасеты под конкретные баги: интенты и поля, эталонные реплики агента, пары «хороший / плохой ответ» для дообучения
- Писать критерии оценки и инструкции для автоматической проверки ответов через LLM (LLM-as-a-judge) и выборочно проверять её оценки
- После каждого релиза или дообучения проверять, что старые баги закрыты и не появились новые
Что мы ждём от тебя
- Коммерческий опыт в тестировании от 2 лет
- Уверенное владение техниками тест-дизайна: классы эквивалентности, граничные значения, таблицы решений, диаграммы состояний и переходов, pairwise
- Умение писать понятные тест-кейсы, чек-листы и баг-репорты; опыт с TMS (TestRail, Qase, Allure TestOps или аналоги)
- Понимание процессов QA: регресс, смоук, приоритизация багов, тестовое покрытие
- Отличная грамотность в русском языке: ты слышишь ошибки в согласовании, неестественные обороты и «канцелярит» в речи
- Внимательность и терпение к монотонной работе с большим объёмом диалогов и разметки
- Уверенная работа с таблицами и JSON: умеешь читать структурированные логи и данные
Будет плюсом
- Опыт тестирования чат-ботов, голосовых ассистентов или других LLM-продуктов
- Опыт разметки данных (Label Studio, Толока или аналоги) и понимание, зачем нужна согласованность разметки
- Базовый Python: скрипты для обработки логов и датасетов, pytest
- Понимание, как работают LLM, промпты и дообучение (SFT, DPO) — хотя бы на уровне идей
- Опыт с API-тестированием (Postman, Swagger)
- Интерес к медицине или опыт работы с клиниками
Что мы предлагаем
- Зарплата 80 000–120 000 ₽ на руки, конкретная сумма — по итогам собеседования
- Удалённая работа
- Оформление по ТК или как самозанятый
- Редкая специализация на стыке QA и AI: оценка качества LLM, данные для дообучения, голосовые интерфейсы
- Прямая связь твоей работы с продуктом: найденный и размеченный баг уходит в дообучение, и ты видишь, как агент перестаёт ошибаться
- Возможность самому выстроить процесс тестирования с нуля