Latência do agente de voz AI: o que causa e como reduzi-lo
A latência acima de 800 ms torna as conversas robóticas. Veja o que contribui para o atraso do agente de voz e estratégias práticas para reduzir os tempos de resposta para menos de 500 ms.
Na conversa humana, o intervalo entre uma pessoa terminar e a outra responder é normalmente de 200 a 400 ms. Quando um agente de IA leva 800 ms ou mais, a conversa parece lenta. Os chamadores começam a falar por cima do agente, criando uma falha em cascata de interrupções e sobreposições estranhas. Latência não é algo bom de se ter – é a diferença entre uma conversa natural e uma conversa obviamente robótica.
De onde vem a latência
- Reconhecimento de fala (ASR): 100–300 ms para transcrever a fala do chamador
- Inferência LLM: 200–800ms para o modelo gerar uma resposta (altamente variável de acordo com o tamanho do modelo e comprimento do prompt)
- Conversão de texto para fala (TTS): 100–200 ms para sintetizar o primeiro pedaço de áudio
- Viagens de ida e volta da rede: 50–150 ms por salto entre serviços
- Execução da ação: 100–500 ms+ para chamadas de API para sistemas externos (pesquisas de CRM, verificações de calendário)
Estratégias de redução
- Respostas de streaming — inicie o TTS assim que os primeiros tokens chegarem do LLM, em vez de esperar pela resposta completa. Esta é a maior vitória de latência.
- Seleção de modelos — use modelos mais rápidos para interações simples e reserve modelos maiores para raciocínios complexos. Diferentes tipos de chamadas podem usar modelos diferentes.
- Otimização de prompts — prompts mais curtos do sistema reduzem o tempo de inferência. Remova instruções desnecessárias.
- Implantação de borda — coloque servidores ASR e TTS geograficamente próximos de seus chamadores.
- Pré-busca — se o agente puder prever as próximas etapas prováveis, faça a pré-busca dos dados antes que o chamador termine de falar.
- Pool de conexões — mantenha conexões persistentes com provedores LLM e TTS em vez de estabelecer novas por solicitação.
Medindo a latência corretamente
Meça de ponta a ponta: desde o momento em que o chamador para de falar até o momento em que ouve a primeira palavra da resposta. Este é o número que determina a qualidade percebida. Medir a latência de componentes individuais é útil para depuração, mas enganoso para avaliar a experiência. Defina uma meta de menos de 500 ms para resposta de primeira palavra em interações padrão.
Pronto para construir?
Veja como os agentes de IA multimodais da Mazed funcionam para o seu caso de uso.