Конвеєр реального часу: як аудіо стає відповіддю агента
Від мікрофона до динаміка менш ніж за 500 мс. Спрощений огляд конвеєра голосового агента — що відбувається на кожному етапі та де ховається затримка.
Коли абонент розмовляє з голосовим агентом, його слова проходять через конвеєр перетворень, перш ніж вони почують відповідь. Розуміння цього конвеєра має важливе значення для діагностики затримки, вибору правильних моделей і знання того, де оптимізувати.
П'ять етапів
- Захоплення та транспортування аудіо — голос абонента захоплюється мікрофоном, кодується та передається на сервер агента. Через PSTN (телефон) це додає 50–150 мс. Через WebRTC (браузер), 20–50 мс.
- Розпізнавання мови (ASR) — аудіопотік транскрибується в текст. Потоковий ASR починає транскрибування, коли абонент говорить, створюючи часткові результати. Остаточна транскрипція відбувається в кінці висловлювання. Бюджет: 100–300 мс.
- Обґрунтування мовної моделі (LLM) — транскрибований текст і контекст розмови надсилаються до LLM для створення відповіді. Потоковий висновок негайно починає створювати токени. Бюджет: 200–600 мс для першого токена.
- Синтез мовлення (TTS) — вихідний текст LLM перетворюється на аудіо. Потоковий TTS починає генерувати аудіо з перших токенів, не чекаючи повної відповіді. Бюджет: 100–200 мс для першого аудіофрагмента.
- Доставка аудіо — синтезований аудіо передається назад на пристрій абонента. Та сама затримка транспортування, що й на кроці 1.
Потокове передавання – це ключова оптимізація
Без потокової передачі кожен етап очікує повного завершення попереднього. Загальна затримка: 1,5–3 секунди. Нестерпний. За допомогою потокової передачі кожен етап обробляється поступово: ASR надсилає часткові транскрипції до LLM, LLM передає маркери до TTS, TTS передає аудіо абоненту. Ефективна затримка падає до 400–700 мс — достатньо швидко, щоб розмова виглядала природно. Ось чому існують платформи, спеціально створені для аудіо в реальному часі: оркестровка потокового передавання – це складна частина.
Готові створювати?
Подивіться, як мультимодальні ШІ-агенти Mazed працюють для вашого випадку використання.