Técnico10 de marzo de 20263 min de lectura

El proceso en tiempo real: cómo el audio se convierte en una respuesta del agente

Del micrófono al altavoz en menos de 500 ms. Un recorrido simplificado por el proceso de agentes de voz: qué sucede en cada etapa y dónde se esconde la latencia.

Cuando una persona que llama habla con un agente de voz, sus palabras viajan a través de un proceso de transformaciones antes de escuchar una respuesta. Comprender este canal es esencial para diagnosticar la latencia, elegir los modelos correctos y saber dónde optimizar.

Las cinco etapas

  1. Captura y transporte de audio: la voz de la persona que llama es capturada por su micrófono, codificada y transmitida al servidor del agente. A través de PSTN (teléfono), esto agrega entre 50 y 150 ms. A través de WebRTC (navegador), 20 a 50 ms.
  2. Reconocimiento de voz (ASR): la transmisión de audio se transcribe a texto. La transmisión ASR comienza a transcribir a medida que la persona que llama habla, lo que produce resultados parciales. La transcripción final ocurre al final del enunciado. Presupuesto: 100–300 ms.
  3. Razonamiento del modelo de lenguaje (LLM): el texto transcrito más el contexto de la conversación se envía al LLM para generar respuestas. La inferencia de transmisión comienza a producir tokens de inmediato. Presupuesto: 200 a 600 ms para el primer token.
  4. Síntesis de voz (TTS): la salida de texto del LLM se convierte en audio. Streaming TTS comienza a generar audio a partir de los primeros tokens sin esperar la respuesta completa. Presupuesto: 100 a 200 ms para el primer fragmento de audio.
  5. Entrega de audio: el audio sintetizado se transmite de regreso al dispositivo de la persona que llama. Misma latencia de transporte que el paso 1.

El streaming es la optimización clave

Sin streaming, cada etapa espera a que la anterior termine por completo. Latencia total: 1,5 a 3 segundos. Intolerable. Con la transmisión, cada etapa se procesa de manera incremental: ASR envía transcripciones parciales al LLM, el LLM transmite tokens a TTS, y TTS transmite audio a la persona que llama. La latencia efectiva cae a 400-700 ms, lo suficientemente rápido como para que la conversación parezca natural. Esta es la razón por la que existen plataformas diseñadas específicamente para audio en tiempo real: la orquestación del streaming es la parte difícil.

¿Listo para construir?

Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.

El proceso en tiempo real: cómo el audio se convierte en una respuesta del agente | Mazed Blog | Mazed