技术2026年3月10日3 分钟阅读
实时管道:音频如何成为代理响应
从麦克风到扬声器的时间不到 500 毫秒。语音代理管道的简化演练 - 每个阶段发生的情况以及隐藏延迟的地方。
当呼叫者与语音代理交谈时,他们的话语会经过一系列转换,然后才能听到响应。了解此管道对于诊断延迟、选择正确的模型以及了解在何处进行优化至关重要。
五个阶段
- 音频捕获和传输 — 呼叫者的语音由麦克风捕获、编码并传输到代理服务器。通过 PSTN(电话),这会增加 50–150 毫秒。通过 WebRTC(浏览器),20–50 毫秒。
- 语音识别 (ASR) — 将音频流转录为文本。流式 ASR 在呼叫者说话时开始转录,产生部分结果。最终转录发生在话语结束时。预算:100–300 毫秒。
- 语言模型推理 (LLM) — 转录文本加上对话上下文被发送到 LLM 以生成响应。流式推理立即开始生成令牌。预算:第一个令牌为 200–600 毫秒。
- 语音合成 (TTS) — 法学硕士的文本输出转换为音频。流式 TTS 开始从第一个令牌生成音频,无需等待完整响应。预算:第一个音频块 100–200 毫秒。
- 音频传输 — 合成的音频被传输回呼叫者的设备。与步骤 1 相同的传输延迟。
流媒体是关键优化
如果没有流式传输,每个阶段都会等待前一个阶段完全完成。总延迟:1.5–3 秒。难以忍受。通过流式处理,每个阶段都会增量处理:ASR 将部分转录发送到 LLM,LLM 将令牌流式传输到 TTS,TTS 将音频流式传输给呼叫者。有效延迟降至 400-700 毫秒,快得足以让对话感觉自然。这就是为什么存在专门为实时音频构建的平台:流编排是最困难的部分。
准备好构建了吗?
了解 Mazed 的多模态 AI 代理如何为您的用例工作。