La capa de aplicación para agentes de IA: por qué el diseño basado en lienzo es el futuro
Los proveedores de infraestructura manejan audio en tiempo real. Los proveedores de modelos manejan el razonamiento. La capa de aplicación (donde se diseña, implementa y monitorea los agentes) es la pieza que falta. Eso es lo que resuelven las plataformas basadas en lienzo.
La pila de agentes de IA tiene tres capas. Infraestructura: transporte de audio/vídeo en tiempo real, telefonía, WebRTC (esto es lo que resuelven LiveKit, Twilio y proveedores similares). Modelos: LLM, ASR, TTS, modelos de visión (esto es lo que resuelven OpenAI, Anthropic, Google y las comunidades de código abierto). Y la capa de aplicación: donde realmente diseña el comportamiento del agente, lo conecta a sus sistemas comerciales, lo implementa para los clientes y monitorea lo que sucede. Esta tercera capa ha estado notoriamente subdesarrollada.
La brecha entre infraestructura y experiencia
Puede iniciar una sesión de audio en tiempo real con un SDK de infraestructura. Puede llamar a una API modelo. Lo que no puede hacer fácilmente: diseñar una conversación de varios pasos con lógica condicional, conectarla a su CRM y calendario, agregar barreras de cumplimiento, implementarla en un número de teléfono, monitorear su desempeño en 10,000 llamadas e iterar el flujo basándose en análisis. Esa es la capa de aplicación: la capa entre la infraestructura y la experiencia del usuario.
Por qué gana el diseño basado en lienzo
Los marcos de agentes basados en código brindan a los ingenieros la máxima flexibilidad pero cero visibilidad para los demás. Las plataformas de solo aviso brindan acceso a los equipos no técnicos, pero sacrifican la confiabilidad y el control. Las plataformas basadas en Canvas como Agent Canvas ocupan el medio correcto: lo suficientemente visuales para que los equipos de producto las comprendan y las modifiquen, lo suficientemente estructuradas para que el cumplimiento las audite y lo suficientemente potentes para que la ingeniería las extienda con acciones e integraciones personalizadas.
Más allá de la voz: el lienzo para todas las modalidades
Hoy en día, los lienzos diseñan conversaciones de voz. Mañana, el mismo lienzo diseña experiencias multimodales: voz + pantalla compartida para la incorporación, voz + cámara para documentación de reclamos, voz + video para verificación de identidad y, eventualmente, transmisión de contenido visual del agente al usuario. La capa de aplicación no se limitará a las llamadas telefónicas: orquestará todas las modalidades a través de las cuales un agente de IA interactúa con un humano. Las empresas que construyen esta capa ahora están creando la herramienta de diseño de interfaz para la próxima década de interacción entre humanos y IA.
¿Listo para construir?
Vea cómo los agentes de IA multimodales de Mazed funcionan para su caso de uso.