Técnico10 de março de 20263 min de leitura

O pipeline em tempo real: como o áudio se torna uma resposta do agente

Do microfone ao alto-falante em menos de 500 ms. Um passo a passo simplificado do pipeline do agente de voz — o que acontece em cada estágio e onde a latência se esconde.

Quando um chamador fala com um agente de voz, suas palavras passam por um processo de transformações antes de ouvir uma resposta. Compreender esse pipeline é essencial para diagnosticar a latência, escolher os modelos certos e saber onde otimizar.

As cinco etapas

  1. Captura e transporte de áudio — a voz do chamador é capturada pelo microfone, codificada e transmitida ao servidor do agente. Por PSTN (telefone), isso adiciona 50–150 ms. Por WebRTC (navegador), 20–50 ms.
  2. Reconhecimento de fala (ASR) — o fluxo de áudio é transcrito para texto. O streaming ASR começa a ser transcrito conforme o chamador fala, produzindo resultados parciais. A transcrição final acontece no final do enunciado. Orçamento: 100–300ms.
  3. Raciocínio do modelo de linguagem (LLM) — o texto transcrito mais o contexto da conversa são enviados ao LLM para geração de resposta. A inferência de streaming começa a produzir tokens imediatamente. Orçamento: 200–600ms para o primeiro token.
  4. Síntese de fala (TTS) — a saída de texto do LLM é convertida em áudio. O streaming TTS começa a gerar áudio a partir dos primeiros tokens sem esperar pela resposta completa. Orçamento: 100–200 ms para o primeiro trecho de áudio.
  5. Entrega de áudio — o áudio sintetizado é transmitido de volta para o dispositivo do chamador. Mesma latência de transporte da etapa 1.

Streaming é a otimização chave

Sem streaming, cada etapa espera que a anterior termine completamente. Latência total: 1,5–3 segundos. Intolerável. Com o streaming, cada estágio processa de forma incremental: o ASR envia transcrições parciais para o LLM, o LLM transmite tokens para o TTS, o TTS transmite áudio para o chamador. A latência efetiva cai para 400–700 ms – rápido o suficiente para que a conversa pareça natural. É por isso que existem plataformas criadas especificamente para áudio em tempo real: a orquestração do streaming é a parte mais difícil.

Pronto para construir?

Veja como os agentes de IA multimodais da Mazed funcionam para o seu caso de uso.

O pipeline em tempo real: como o áudio se torna uma resposta do agente | Mazed Blog | Mazed