Saltar al contenido
Implementa.
← Todo el glosario

Barandillas de agentes

seguridad

guardrails · guardarraíles de agentes · agent guardrails · barandillas de IA

Controles que se ejecutan en tiempo real sobre lo que entra al agente, lo que sale y lo que puede tocar: bloquean, redactan o detienen la acción antes de que llegue al usuario o al sistema.

Una barandilla no opina, corta. Se pone en tres sitios: en la entrada (valida la petición, el contenido recuperado y la memoria antes de que el modelo los lea), en la salida (bloquea o redacta antes de que el texto llegue a alguien) y en la acción (limita qué herramientas puede llamar el agente, con qué permisos y sobre qué datos). La diferencia práctica con todo lo demás del stack de seguridad es el momento: la evaluación te dice antes de desplegar si el agente es bueno; la observabilidad te cuenta después qué pasó; la barandilla es lo único que actúa durante. Si tu única defensa está en el prompt del sistema, no tienes barandillas: tienes una petición educada.

En qué se diferencia de

Gobernanza de agentes
La gobernanza es la política: quién decide qué puede hacer un agente y quién responde. La barandilla es la ejecución de esa política en runtime. Política sin barandilla es un documento; barandilla sin política es un parche.
Evaluación de agentes (evals)
Las evals miden calidad contra casos conocidos, normalmente antes de desplegar o en integración continua. Las barandillas actúan en cada petición real, incluyendo las que ningún eval anticipó.
Human in the loop
El HITL mete a una persona en la decisión. La barandilla decide sola y en milisegundos. Se usan juntos: la barandilla filtra el volumen y escala al humano solo lo que merece un juicio.

Ejemplos

  • Bloquear una salida que contiene datos personales antes de que llegue al chat del cliente.
  • Impedir que un agente de compras llame a la herramienta de pago por encima de un importe sin aprobación humana.

Preguntas frecuentes

¿Las barandillas frenan al agente?
Añaden latencia, sí, y ese es el precio de que no te publique una alucinación o no filtre un dato personal. El error caro no es la barandilla lenta: es la acción irreversible que nadie interceptó.
¿Basta con poner las reglas en el prompt del sistema?
No. El prompt es una instrucción que el modelo puede ignorar y que una inyección puede sobrescribir. La barandilla es código fuera del modelo que se aplica aunque el agente esté comprometido — por eso funciona.

Términos relacionados

Fuentes y lecturas