Producto15 de marzo de 20263 min de lectura

Barandillas en Agent Canvas: controles estructurales para agentes de IA

Las barreras de seguridad en Agent Canvas no son instrucciones rápidas: son restricciones estrictas en el gráfico de conversación que el LLM no puede eludir. Así es como funcionan.

Cuando le dice a un LLM que "nunca brinde asesoramiento médico", está confiando en el cumplimiento probabilístico. Cuando agrega un nodo de barrera en Agent Canvas que detecta temas médicos y rutas a un flujo de escalada, está imponiendo una restricción estructural. La diferencia: a veces uno falla. El modelo no puede pasar por alto el otro.

Tipos de barandillas

  • Bloques de temas: evitan que el agente interactúe con temas específicos (precios de la competencia, diagnóstico médico, asesoramiento legal). La detección ocurre en la capa de orquestación, no en el mensaje.
  • Divulgaciones obligatorias: introduzca el lenguaje requerido en puntos específicos: divulgación de la identidad de la IA al inicio de la llamada, lenguaje de cumplimiento antes de las transacciones financieras, registro de notificaciones de consentimiento.
  • Activadores de escalada: transferencia humana automática cuando se cumplen las condiciones: el cliente solicita a un ser humano, el sentimiento cae por debajo del umbral, la conversación excede el límite de complejidad.
  • Reglas de manejo de datos: elimine información confidencial de los registros, evite el almacenamiento de datos de pago y aplique el cifrado a nivel de campo para la PII.
  • Límites de acción: restringe qué herramientas puede usar el agente y bajo qué condiciones (por ejemplo, puede procesar reembolsos de menos de $50 de forma autónoma, debe escalar por encima de $50).

Las barandillas son visibles en el lienzo.

Cada barrera de seguridad es un nodo o borde visible en el gráfico de conversación. Los equipos de cumplimiento pueden auditar el flujo inspeccionando el lienzo: pueden ver dónde se inyectan las divulgaciones, dónde ocurre la escalada y qué filtros de temas están activos. Esta auditabilidad es imposible con sistemas de solo avisos donde las barreras de seguridad están ocultas en párrafos de instrucciones en lenguaje natural que pueden seguirse o no.

¿Listo para construir?

Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.

Barandillas en Agent Canvas: controles estructurales para agentes de IA | Mazed Blog | Mazed