Latencia del agente de voz de IA: qué la causa y cómo reducirla
La latencia superior a 800 ms hace que las conversaciones parezcan robóticas. Esto es lo que contribuye al retraso del agente de voz y las estrategias prácticas para reducir los tiempos de respuesta por debajo de 500 ms.
En una conversación humana, el intervalo entre que una persona termina y la otra responde suele ser de 200 a 400 ms. Cuando un agente de IA tarda 800 ms o más, la conversación se vuelve lenta. Las personas que llaman comienzan a hablar por encima del agente, lo que crea una cascada de interrupciones y superposiciones incómodas. La latencia no es algo agradable: es la diferencia entre una conversación natural y una obviamente robótica.
De dónde viene la latencia
- Reconocimiento de voz (ASR): 100 a 300 ms para transcribir el discurso de la persona que llama
- Inferencia LLM: 200 a 800 ms para que el modelo genere una respuesta (muy variable según el tamaño del modelo y la duración del mensaje)
- Texto a voz (TTS): 100 a 200 ms para sintetizar el primer fragmento de audio
- Viajes de ida y vuelta de red: 50 a 150 ms por salto entre servicios
- Ejecución de acciones: 100–500 ms+ para llamadas API a sistemas externos (búsquedas de CRM, comprobaciones de calendario)
Estrategias de reducción
- Transmisión de respuestas: inicie TTS tan pronto como lleguen los primeros tokens del LLM, en lugar de esperar la respuesta completa. Esta es la mayor ganancia en latencia.
- Selección de modelos: utilice modelos más rápidos para interacciones simples y reserve modelos más grandes para razonamientos complejos. Diferentes tipos de llamadas pueden utilizar diferentes modelos.
- Optimización rápida: las indicaciones más breves del sistema reducen el tiempo de inferencia. Elimina instrucciones innecesarias.
- Implementación perimetral: coloque servidores ASR y TTS geográficamente cerca de quienes llaman.
- Búsqueda previa: si el agente puede predecir los próximos pasos probables, obtenga datos antes de que la persona que llama termine de hablar.
- Agrupación de conexiones: mantenga conexiones persistentes con proveedores de LLM y TTS en lugar de establecer nuevas por solicitud.
Medir la latencia correctamente
Medida de extremo a extremo: desde que el llamante deja de hablar hasta que escucha la primera palabra de la respuesta. Este es el número que determina la calidad percibida. Medir la latencia de los componentes individuales es útil para la depuración, pero es engañoso para evaluar la experiencia. Establezca un objetivo de menos de 500 ms para la respuesta de primera palabra en interacciones estándar.
¿Listo para construir?
Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.