Bitmanager.ai - AI-стартап в одной из самых быстрорастущих категорий conversational AI agents.
Мы создаёт платформу для голосовых и текстовых AI-агентов в клиентских коммуникациях: продажах, поддержке, консультациях и debt collection.
Наши агенты работают с данными, обращаются к внутренним системам компаний, вызывают инструменты и ведут диалог в рамках заданных бизнес-сценариев.
Мы развиваем мультиязычные голосовые решения и самостоятельно дообучаем модели, чтобы расширять количество поддерживаемых языков и повышать качество работы продукта.
Сейчас мы в поиске сильного инженера по речевым технологиям, который отвечает за результат в реальном звонке, а не за метрику на офлайн-датасете. Специалист возьмёт одно из голосовых направлений - распознавание или синтез речи, - будет развивать его для новых языков и отвечать за работу этих сервисов в проде.
Главный результат работы: агент, который слышит собеседника, отвечает быстро и звучит естественно - на всех поддерживаемых языках.
Чем предстоит заниматься
- Взять на себя одно из голосовых направлений - потоковое распознавание речи (ASR) или синтез (TTS) - и развивать его, в том числе для языков с малым количеством данных и готовых решений;
- Отвечать за задержки: измерять и сокращать время от конца реплики собеседника до первого звука ответа агента;
- Развивать естественность диалога: чтобы агент вовремя понимал, что собеседник закончил мысль, спокойно реагировал на перебивания и паузы и в живом разговоре вёл себя как человек, а не как робот;
- Работать с особенностями телефонии: узкополосный звук, потоковая передача, эхо, потери пакетов, разбор записей реальных звонков;
- Дообучать и адаптировать речевые модели под наши задачи и новые языки, вместе с командой подготовки данных и языковыми экспертами;
- Строить систему оценки качества: офлайн-метрики распознавания и синтеза, сквозные прогоны на реальных звонках, регрессионные проверки перед выкаткой;
- Выстраивать процессы выкатки и эксплуатации речевых сервисов на GPU - сборка, деплой, мониторинг, разбор инцидентов - и контролировать их качество. Делать всё самому руками не обязательно, но ответственность за то, чтобы эти процессы работали, лежит на нём;
- Доводить жалобы на качество звонков до конкретной причины: модель, данные, аудиотракт или инфраструктура;
- Участвовать в развёртывании речевой части в инфраструктуре заказчика вместе с инфраструктурной командой;
- Задавать технические решения по голосовому направлению, ревьюить код и помогать расти другим инженерам команды.
Что для нас важно
- Уверенный Python и опыт разработки production-сервисов, а не только исследовательских скриптов;
- Практический опыт с речевыми технологиями (ASR и/или TTS), обязательно включая опыт интеграции моделей в production и их дальнейшей эксплуатации. Только исследовательского опыта или только обучения моделей недостаточно;
- Понимание потоковой обработки аудио: буферизация, работа чанками, источники задержек, ограничения реального времени;
- Опыт с PyTorch и запуском моделей на GPU, понимание того, из чего складывается время инференса;
- Умение измерять качество: подобрать метрику, собрать тестовый набор, отличить реальное улучшение от шума;
- Опыт эксплуатации: Docker, логи, мониторинг, отладка проблем, которые воспроизводятся только в проде;
- Способность самостоятельно вести направление, принимать решения при неполных данных и отвечать за результат;
- Умение работать с продуктовой командой, лингвистами и техническими специалистами заказчика и понятно объяснять свои решения;
- Хороший русский и английский язык: чтение документации и статей, общение с командой;
- Готовность регулярно работать из офиса компании в Москве. Полностью удалённый формат возможен в исключительных случаях и при небольшой разнице с московским часовым поясом.
Опыт именно с голосовыми агентами не обязателен. Важнее инженерная зрелость, опыт работы со звуком и умение быстро разбираться в чужом пайплайне.
Будет плюсом
- Опыт с телефонией: SIP, RTP, кодеки, эхоподавление, работа со звуком 8 кГц;
- Опыт построения голосовых агентов или диалоговых систем реального времени;
- Опыт с VAD, определением конца реплики и обработкой перебиваний;
- Опыт дообучения TTS (SFT, LoRA) и работы с клонированием голоса по референсу;
- Опыт с мультиязычными речевыми моделями и языками с малым количеством данных;
- Опыт оптимизации инференса: батчинг, квантизация, ONNX, TensorRT, vLLM;
- Опыт on-premise-развёртывания ML-сервисов в инфраструктуре крупных заказчиков;
- Опыт работы с LLM в составе голосового пайплайна.
Если вам интересно не просто улучшать метрики на offline-датасете, а отвечать за то, как агент слышит, отвечает и звучит в реальном звонке, - ждем вашего отклика. Будем рады познакомиться и обсудить, какое voice-направление вы сможете взять под свою ответственность.