Produit15 mars 20263 min de lecture

Garde-corps dans Agent Canvas : contrôles structurels pour les agents IA

Les garde-fous dans Agent Canvas ne sont pas des instructions rapides : ce sont des contraintes strictes dans le graphique de conversation que le LLM ne peut pas contourner. Voici comment ils fonctionnent.

Lorsque vous dites à un LLM « ne donnez jamais de conseils médicaux », vous vous appuyez sur une conformité probabiliste. Lorsque vous ajoutez un nœud de garde-corps dans Agent Canvas qui détecte les sujets médicaux et les achemine vers un flux d'escalade, vous appliquez une contrainte structurelle. La différence : on échoue parfois. L’autre ne peut être contourné par le modèle.

Types de garde-corps

  • Blocs de sujets : empêchent l'agent d'aborder des sujets spécifiques (tarifications des concurrents, diagnostic médical, conseils juridiques). La détection se produit au niveau de la couche d'orchestration, et non à l'invite.
  • Divulgations obligatoires : injectez le langage requis à des points spécifiques : divulgation de l'identité de l'IA au début de l'appel, langage de conformité avant les transactions financières, enregistrement des notifications de consentement.
  • Déclencheurs d'escalade : transfert humain automatique lorsque les conditions sont remplies : les demandes du client sont humaines, le sentiment tombe en dessous du seuil, la conversation dépasse la limite de complexité.
  • Règles de traitement des données : supprimez les informations sensibles des journaux, empêchez le stockage des données de paiement, appliquez le cryptage au niveau du champ pour les informations personnelles.
  • Limites d'action : restreignent les outils que l'agent peut utiliser et dans quelles conditions (par exemple, peut traiter les remboursements de moins de 50 $ de manière autonome, doit augmenter au-dessus de 50 $).

Des garde-corps sont visibles dans la toile

Chaque garde-corps est un nœud ou un bord visible dans le graphique de conversation. Les équipes de conformité peuvent auditer le flux en inspectant le canevas : elles peuvent voir où les divulgations sont injectées, où la remontée des informations se produit et quels filtres de sujets sont actifs. Cette auditabilité est impossible avec les systèmes à invite uniquement où les garde-fous sont enfouis dans des paragraphes d'instructions en langage naturel qui peuvent ou non être suivis.

Prêt à construire ?

Découvrez comment les agents IA multimodaux de Mazed fonctionnent pour votre cas d'utilisation.

Garde-corps dans Agent Canvas : contrôles structurels pour les agents IA | Mazed Blog | Mazed