Garde-corps dans Agent Canvas : contrôles structurels pour les agents IA
Les garde-fous dans Agent Canvas ne sont pas des instructions rapides : ce sont des contraintes strictes dans le graphique de conversation que le LLM ne peut pas contourner. Voici comment ils fonctionnent.
Lorsque vous dites à un LLM « ne donnez jamais de conseils médicaux », vous vous appuyez sur une conformité probabiliste. Lorsque vous ajoutez un nœud de garde-corps dans Agent Canvas qui détecte les sujets médicaux et les achemine vers un flux d'escalade, vous appliquez une contrainte structurelle. La différence : on échoue parfois. L’autre ne peut être contourné par le modèle.
Types de garde-corps
- Blocs de sujets : empêchent l'agent d'aborder des sujets spécifiques (tarifications des concurrents, diagnostic médical, conseils juridiques). La détection se produit au niveau de la couche d'orchestration, et non à l'invite.
- Divulgations obligatoires : injectez le langage requis à des points spécifiques : divulgation de l'identité de l'IA au début de l'appel, langage de conformité avant les transactions financières, enregistrement des notifications de consentement.
- Déclencheurs d'escalade : transfert humain automatique lorsque les conditions sont remplies : les demandes du client sont humaines, le sentiment tombe en dessous du seuil, la conversation dépasse la limite de complexité.
- Règles de traitement des données : supprimez les informations sensibles des journaux, empêchez le stockage des données de paiement, appliquez le cryptage au niveau du champ pour les informations personnelles.
- Limites d'action : restreignent les outils que l'agent peut utiliser et dans quelles conditions (par exemple, peut traiter les remboursements de moins de 50 $ de manière autonome, doit augmenter au-dessus de 50 $).
Des garde-corps sont visibles dans la toile
Chaque garde-corps est un nœud ou un bord visible dans le graphique de conversation. Les équipes de conformité peuvent auditer le flux en inspectant le canevas : elles peuvent voir où les divulgations sont injectées, où la remontée des informations se produit et quels filtres de sujets sont actifs. Cette auditabilité est impossible avec les systèmes à invite uniquement où les garde-fous sont enfouis dans des paragraphes d'instructions en langage naturel qui peuvent ou non être suivis.
Prêt à construire ?
Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.