Санкт-Петербург, Центральный район, улица Некрасова
AI/ML Engineer / Generative AI Engineer
ARCHIDIGITAL ищет AI/ML-инженера для разработки интерактивных систем на базе локальных нейросетевых моделей.
Нам нужен специалист, который умеет самостоятельно разворачивать модели на локальных GPU-серверах, объединять языковые, голосовые и видео-модели в единую систему и оптимизировать их работу под минимальную задержку.
Текущая задача
Интерактивная инсталляция «Мягкий телефон Мишки».
Это детский телефон с микрофоном и динамиком для детского реабилитационного центра, подключенный к локальному серверу.
Пользователь говорит с персонажем Мишкой. Сервер должен принимать голос, распознавать речь, формировать ответ языковой моделью, синтезировать его голосом персонажа и возвращать аудио в телефон с минимальной задержкой.
Необходимо разработать серверную часть системы, включая:
прием и обработку аудиопотока
Speech-to-Text
работу локальной языковой модели
логику и контекст диалога
Text-to-Speech и имитацию голоса персонажа
потоковую обработку данных
API взаимодействия с устройством
оптимизацию end-to-end latency
стабильную работу системы на локальном сервере
Следующее направление работы — GENMIRROR
GENMIRROR — интерактивная система ARCHIDIGITAL для нейросетевой обработки видеопотока в реальном времени.
Специалист будет участвовать в дальнейшем развитии проекта: подключении новых генеративных моделей, построении и оптимизации локальных inference pipeline, работе с image и video моделями и развитии серверной архитектуры.
Основные требования
уверенный Python
PyTorch
Linux
Docker
CUDA и понимание работы GPU
опыт развертывания open-source моделей локально
понимание современных LLM
опыт работы со Speech-to-Text и Text-to-Speech
опыт с voice cloning или voice conversion
понимание streaming inference
умение строить системы из нескольких связанных AI-моделей
опыт оптимизации inference и задержки
понимание VRAM, quantization и управления GPU-ресурсами
умение самостоятельно изучать, запускать и интегрировать новые open-source модели
Будет преимуществом
опыт с Whisper, faster-whisper или аналогами
опыт с vLLM, llama.cpp, TensorRT, ONNX Runtime
опыт с современными TTS и voice cloning моделями
опыт с Stable Diffusion, FLUX или генеративными video-моделями
LoRA и fine-tuning
WebSocket, gRPC или WebRTC
опыт разработки realtime AI-систем
Кого мы ищем
Нам нужен инженер, способный работать не только с внешними API, а непосредственно с моделями, локальной инфраструктурой и GPU inference.
Важно уметь самостоятельно подобрать модель, развернуть ее, интегрировать в систему, оптимизировать и довести до стабильной работы.
Формат работы
Проектная работа с возможностью постоянного сотрудничества.
В отклике желательно прислать GitHub или примеры проектов и кратко описать опыт с локальными LLM, STT, TTS, voice cloning и GPU inference.
В первую очередь рассматриваются кандидаты из Санкт-Петербурга и ЛО в связи с необходимостью очных встреч по проектам.