Добрый день!
Мы — Sasha AI, пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.
Мы выросли в 5 раз за год, а наша цель на 2026-й — оборот 400 млн ₽.
Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.
Наша большая цель — за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.
Голос — первое, что слышит клиент. Если синтез звучит роботом, неправильно ставит ударение или отвечает с задержкой, человек кладёт трубку. Мы ищем инженера, который возьмёт на себя синтез речи в нашем каскаде STT → LLM → TTS: от данных и дообучения до быстрого инференса и мониторинга в продакшене.
Чем предстоит заниматься
- Дообучать современные TTS-модели под русскую диалоговую речь, в первую очередь LLM-based, LoRA/QLoRA, full fine-tuning, выравнивание по предпочтениям (DPO) для естественности звучания.
- Строить пайплайны данных для обучения:
- сбор аудио из реальных звонков и студийных записей;
- очистка, сегментация, выравнивание текста и аудио;
- фильтрация по качеству, автоматическая разметка.
- Развивать фронтенд синтеза: нормализация текста (числа, даты, адреса, телефоны), ударения и омографы, G2P.
- Оптимизировать инференс: квантизация, стриминговый синтез, минимальное время до первого звука, высокая плотность потоков на GPU (vLLM, ONNX, TensorRT).
- Встраивать TTS в каскад: стыковка с LLM (формат ответа, стриминг по токенам), обработка перебиваний, адаптация к телефонному каналу (8 кГц, G.711/Opus).
- Строить наблюдаемость синтеза в продакшене: трейсинг через OpenTelemetry, метрики latency и RTF в Prometheus, дашборды в Grafana, отлов деградаций.
- Выстраивать оценку качества:
- MOS/CMOS-тесты;
- автоматические метрики (UTMOS, CER через ASR, speaker similarity);
- регрессионные прогоны;
- связь с доходимостью разговоров.
- Создавать новые голоса и адаптировать синтез под клиентов (voice cloning).
Что мы ждём
- Коммерческий опыт от 1 года в ML и дообученные модели, доведённые до продакшена.
- Опыт дообучения трансформерных или LLM-моделей: LoRA/QLoRA, SFT, желательно DPO.
- Уверенный Python, PyTorch, Hugging Face (Transformers, PEFT).
- Опыт квантизации и оптимизации моделей под ограниченные ресурсы и низкую задержку.
- Умение собирать и валидировать датасеты для обучения.
- Понимание, как устроен голосовой каскад STT–LLM–TTS и где в нём теряется время.
- Опыт с Docker, CI/CD, развёртыванием и мониторингом ML-сервисов.
- Желание глубоко погрузиться в синтез речи.
Будет плюсом
- Опыт работы с TTS-моделями: обучение, дообучение или интеграция в продукт.
- Понимание нейрокодеков (EnCodec, DAC, SNAC, Mimi) и вокодеров (HiFi-GAN, Vocos).
- Базовые знания цифровой обработки сигналов: спектрограммы, mel, частота дискретизации.
- C++ для оптимизации критичных по производительности компонентов, опыт потоковой обработки данных.
- Опыт с Airflow, ClickHouse, Kafka для работы с большими объёмами аудио и метаданных.
- Сильная математическая или физическая база.
Что мы предлагаем
- Синтез речи, который ежедневно звучит в тысячах живых разговоров, и видимый эффект в конверсии.
- Полный цикл: данные → обучение → оптимизация → продакшен → мониторинг.
- GPU и реальные данные для экспериментов.
- Небольшую команду без бюрократии и быстрый путь от идеи до релиза.
- Возможность вырасти до senior и взять направление TTS целиком.