Actions en cours de conversation : comment les agents exécutent les outils sans interrompre le flux
Le moment où un agent s'arrête pour « rechercher quelque chose » est déterminant pour la qualité de la conversation. Voici comment fonctionne l’exécution d’une action sans interrompre le flux.
Un agent vocal qui ne peut que parler est une nouveauté. Un agent vocal capable de prendre des rendez-vous, de rechercher des comptes, de traiter des paiements et de mettre à jour des enregistrements en cours de conversation est un outil. Le défi : chaque action introduit de la latence. Si l'agent reste silencieux pendant trois secondes lors de l'appel d'une API, l'appelant pense que la connexion a été interrompue.
Le problème de latence avec les actions
Une recherche CRM typique prend 200 à 500 ms. Un contrôle de disponibilité du calendrier : 300 à 800 ms. Un appel API de paiement : 500 à 1 500 ms. Pendant ce temps, le flux audio est silencieux. Sans manipulation, l'appelant entend de l'air mort et commence à dire « Bonjour ? » Es-tu là?' – faire dérailler la conversation.
Comment Agent Canvas le gère
Les nœuds d'action dans Agent Canvas prennent en charge le comportement de remplissage pendant l'exécution de l'action. L'agent dit « Laissez-moi vérifier cela pour vous » et conserve un espace de conversation naturel avec de brèves mises à jour de statut pendant que l'appel API se termine en arrière-plan. Le flux audio ne reste jamais silencieux. Une fois l’action terminée, l’agent intègre le résultat dans la réponse suivante de manière transparente. L'appelant subit une pause naturelle, et non un délai d'attente technique.
Actions parallèles ou séquentielles
Lorsque l'agent a besoin de plusieurs points de données (nom du client issu du CRM + disponibilité du calendrier + solde du compte), leur exécution séquentielle augmente la latence. Agent Canvas prend en charge l'exécution d'actions parallèles : lancez les trois appels d'API simultanément, combinez les résultats et répondez une fois. Cela réduit une chaîne séquentielle de 1,5 seconde à une exécution parallèle de 500 ms – une différence que l’appelant peut ressentir.
Prêt à construire ?
Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.