← к выдаче
данные

AI Engineer (Senior) - Speech & Voice AI

ForteBankАстана5 дн. назад

Коротко

Selects, trains, and fine-tunes ASR/TTS and speech-to-speech models for bank voice AI services, designs real-time dialogues, and integrates with LiveKit Agents. · Needs: Proficient in Python and PyTorch; hands-on experience training or fine-tuning speech models; experience with LiveKit Agents or similar; knowledge of streaming

Описание от работодателя

Обязанности: Подбирать, обучать и дообучать модели распознавания и синтеза речи (ASR/TTS), а также speech-to-speech модели для голосовых AI-сервисов банка. Развивать качество работы моделей на казахском и русском языках: учитывать смешанную речь, банковскую терминологию, имена, суммы и шумные условия. Проектировать голосовые диалоги в реальном времени: потоковую обработку аудио, определение конца реплики, обработку перебиваний и full-duplex взаимодействие, при котором агент одновременно слушает пользователя и отвечает ему. Готовить речевые датасеты: очищать и размечать аудио, формировать обучающие и тестовые выборки, проводить эксперименты и анализировать ошибки моделей. Интегрировать речевые модели с голосовыми агентами на LiveKit Agents или аналогичной платформе, backend-сервисами и мобильными каналами банка. Оптимизировать качество и скорость ответа, потребление GPU и устойчивость сервиса при одновременных голосовых сессиях. Готовить модели и голосовые сервисы к промышленной эксплуатации в защищённом контуре банка. Требования: Уверенное владение Python и PyTorch. Практический опыт обучения или fine-tuning речевых моделей, а не только интеграции готовых облачных ASR/TTS API. Обязательный опыт работы с LiveKit Agents / LiveKit Server либо аналогами для потоковых голосовых приложений. Понимание архитектур ASR, TTS и speech-to-speech, методов подготовки аудиоданных и оценки качества речевых моделей. Опыт работы со streaming inference, VAD, turn detection, endpointing и обработкой перебиваний (barge-in). Понимание особенностей full-duplex диалога, включая одновременную речь пользователя и агента. Опыт вывода ML-моделей в production: разработка API, Docker, мониторинг, профилирование и оптимизация инференса на GPU. Умение строить воспроизводимые эксперименты и находить баланс между качеством модели, задержкой ответа и стоимостью вычислений. Будет преимуществом: ​​​​​​​ Опыт обучения речевых моделей для казахского языка и работы с переключением между казахским и русским языками в одной реплике. Практический опыт с full-duplex speech-to-speech моделями. Опыт развёртывания речевых моделей on-premise и работы с чувствительными данными в регулируемой среде. ​​​