Perspektiven2. März 20263 Min. Lesezeit

Hören Sie auf, Sprachagenten von Grund auf neu zu entwickeln

Das Zusammenfügen von ASR-, LLM- und TTS-APIs klingt einfach. In der Praxis sind es Monate des Edge-Case-Engineerings, die eine Plattform vom ersten Tag an bewältigt.

Der Grundgedanke für den Aufbau eines eigenen Sprachagenten ist überzeugend: Rufen Sie eine ASR-API auf, leiten Sie den Text an ein LLM weiter, senden Sie die Antwort an TTS, streamen Sie das Audio zurück. Drei API-Aufrufe. Ein Wochenendprojekt. Anschließend probieren Sie es mit einem echten Anrufer aus und entdecken, wie die restlichen 90 % der Arbeit aussehen.

Der Eisberg der Echtzeitstimme

  • Unterbrechungsbehandlung – der Anrufer spricht über den Agenten. Hören Sie auf zu generieren? Weitermachen? Die Antwort hängt davon ab, ob es sich um eine echte Unterbrechung oder einen Rückkanal („uh-huh“) handelt. Dies allein ist ein Forschungsproblem.
  • Abbiegeerkennung – wann hat der Anrufer tatsächlich zu Ende gesprochen? VAD fängt Stille ein, übersieht aber Pausen mitten im Gedanken. Endpointing hilft, erhöht aber die Latenz. Wenn man das falsch macht, reden Agenten über Anrufer oder warten zu lange.
  • Echounterdrückung – das Gerät des Anrufers spielt die Stimme des Agenten ab, die das Mikrofon aufnimmt und an ASR zurückmeldet. Ohne ordnungsgemäße Echobehandlung hört sich der Agent selbst und erzeugt eine Rückkopplungsschleife.
  • Randfälle der Telefonie – DTMF-Töne, Anrufweiterleitungen, Wartemusik, Voicemail-Erkennung, Konferenzgespräche, SIP-Protokollvariationen zwischen den Mobilfunkanbietern.
  • Latenzoptimierung – Streaming-Antworten, Verbindungspooling, Modellaufwärmphase, regionale Bereitstellung. Jeder spart 50–100 ms, und Sie brauchen alle davon.

Was bauen und was kaufen?

Bauen Sie Ihre Konversationslogik, Wissensdatenbank und Integrationen auf – das sind Ihre Unterscheidungsmerkmale. Kaufen Sie die Echtzeit-Audio-Infrastruktur, Abbiegeerkennung, Unterbrechungsbehandlung und Telefonverwaltung – das sind Standardprobleme, die gelöst wurden. Eine Plattform mit einer visuellen Leinwand für die Konversationsgestaltung gibt Ihrem Team Geschwindigkeit bei den wichtigen Teilen und bewältigt gleichzeitig die Komplexität der Infrastruktur, die Ihren Agenten nicht einzigartig wertvoll macht.

Bereit loszulegen?

Erleben Sie, wie Mazeds multimodale KI-Agenten für Ihren Use Case arbeiten.

Hören Sie auf, Sprachagenten von Grund auf neu zu entwickeln | Mazed Blog | Mazed