Barandillas de agentes
seguridadguardrails · guardarraíles de agentes · agent guardrails · barandillas de IA
Controles que se ejecutan en tiempo real sobre lo que entra al agente, lo que sale y lo que puede tocar: bloquean, redactan o detienen la acción antes de que llegue al usuario o al sistema.
Una barandilla no opina, corta. Se pone en tres sitios: en la entrada (valida la petición, el contenido recuperado y la memoria antes de que el modelo los lea), en la salida (bloquea o redacta antes de que el texto llegue a alguien) y en la acción (limita qué herramientas puede llamar el agente, con qué permisos y sobre qué datos). La diferencia práctica con todo lo demás del stack de seguridad es el momento: la evaluación te dice antes de desplegar si el agente es bueno; la observabilidad te cuenta después qué pasó; la barandilla es lo único que actúa durante. Si tu única defensa está en el prompt del sistema, no tienes barandillas: tienes una petición educada.
En qué se diferencia de
- Gobernanza de agentes
- La gobernanza es la política: quién decide qué puede hacer un agente y quién responde. La barandilla es la ejecución de esa política en runtime. Política sin barandilla es un documento; barandilla sin política es un parche.
- Evaluación de agentes (evals)
- Las evals miden calidad contra casos conocidos, normalmente antes de desplegar o en integración continua. Las barandillas actúan en cada petición real, incluyendo las que ningún eval anticipó.
- Human in the loop
- El HITL mete a una persona en la decisión. La barandilla decide sola y en milisegundos. Se usan juntos: la barandilla filtra el volumen y escala al humano solo lo que merece un juicio.
Ejemplos
- Bloquear una salida que contiene datos personales antes de que llegue al chat del cliente.
- Impedir que un agente de compras llame a la herramienta de pago por encima de un importe sin aprobación humana.
Preguntas frecuentes
- ¿Las barandillas frenan al agente?
- Añaden latencia, sí, y ese es el precio de que no te publique una alucinación o no filtre un dato personal. El error caro no es la barandilla lenta: es la acción irreversible que nadie interceptó.
- ¿Basta con poner las reglas en el prompt del sistema?
- No. El prompt es una instrucción que el modelo puede ignorar y que una inyección puede sobrescribir. La barandilla es código fuera del modelo que se aplica aunque el agente esté comprometido — por eso funciona.