Technisch17. März 20263 Min. Lesezeit

Warum multimodale Agenten eine andere Architektur benötigen als rein sprachbasierte Agenten

Sie können einer Sprachpipeline kein Video hinzufügen und es als multimodal bezeichnen. Echte multimodale Agenten erfordern parallele Verarbeitung, einheitliche Argumentation und eine Laufzeit, die für den Modalitätswechsel ausgelegt ist.

Ein Sprachagent verfügt über eine lineare Pipeline: Audioeingang → ASR → LLM → TTS → Audioausgang. Ein multimodaler Agent führt parallele Streams aus: Audioeingang + Videobilder → ASR + Vision-Modell → einheitliches LLM-Argument → TTS + optionale visuelle Ausgabe. Der Unterschied ist nicht additiv, sondern architektonischer Natur. Das System muss zu jedem Zeitpunkt entscheiden, welche Modalität es priorisiert, wie es Eingaben aus verschiedenen Richtungen zusammenführt und wie es die Rechenleistung auf die Streams verteilt.

Modalitätsfusion, kein Modalitätswechsel

Ein naives multimodales System wechselt zwischen den Modi: entweder Zuhören oder Schauen. Ein richtiges multimodales System bündelt Eingaben: Der Agent hört, wie der Kunde sagt: „Dieser ist kaputt“, während er gleichzeitig sieht, wie er auf einen bestimmten Artikel auf dem Bildschirm zeigt. Das Wort „dies“ löst sich nur im visuellen Kontext auf. Diese modalübergreifende Lösung erfordert ein Argumentationsmodell, das beide Eingaben gleichzeitig und nicht nacheinander berücksichtigt.

Nahtlose Modalitätsübergänge

Der Agent startet als Sprachanruf. Der Kunde benötigt Hilfe bei der Navigation in seinem Konto, daher bietet der Agent eine Bildschirmfreigabe an. Jetzt ist es Sprach- und Bildschirmfreigabe. Der Kunde zeigt ein Dokument vor der Kamera – jetzt ist es Stimme + Vision. Diese Übergänge sollten aus Sicht des Benutzers und aus Sicht des Agenten nahtlos sein. Der Gesprächsstatus, der Kontext und die Persona übertragen Modalitätsänderungen ohne Neustart. Dies erfordert eine einheitliche Sitzungslaufzeit und keine separaten Sprach- und Videodienste, die zusammengefügt werden.

Bereit loszulegen?

Erleben Sie, wie Mazeds multimodale KI-Agenten für Ihren Use Case arbeiten.

Warum multimodale Agenten eine andere Architektur benötigen als rein sprachbasierte Agenten | Mazed Blog | Mazed