Saltar al contenido
Implementa.
← Todo el glosario

Seguridad de IA agéntica

seguridad

agentic AI security · seguridad de agentes de IA · AI agent security

Proteger sistemas que persiguen un objetivo y actúan solos: controles dinámicos, monitorización continua y acceso adaptativo, porque la superficie de ataque ya no es la aplicación sino lo que el agente puede hacer con sus permisos.

Con una aplicación clásica sabes de antemano qué llamadas puede hacer. Con un agente no: el plan lo decide él en ejecución, en función de un texto que puede venir de un correo, de una web o de un documento subido por un tercero. Eso cambia la pregunta de seguridad: deja de ser 'quién puede entrar' y pasa a ser 'qué puede hacer esto, con las credenciales de quién y sin que nadie lo apruebe'. De ahí las tres piezas: identidad propia por agente (no compartir la de una persona), permiso mínimo y temporal por acción (no acceso permanente al sistema entero) y traza completa de cada llamada a herramienta, para poder reconstruir qué hizo y por qué. Añade a eso el problema nuevo: la inyección de instrucciones a través del contenido que el agente lee, que no tiene equivalente en el software tradicional.

En qué se diferencia de

Seguridad de LLM
La seguridad de LLM se ocupa de lo que el modelo dice: toxicidad, fugas en la salida, inyección de prompt. La seguridad agéntica se ocupa de lo que el sistema hace: qué herramienta llama, con qué permisos y sobre qué sistema real.
Gobernanza de IA
La gobernanza define política y responsabilidad. La seguridad agéntica implementa los controles técnicos que impiden la acción indebida. Se puede tener un comité impecable y un agente con acceso de administrador.

Ejemplos

  • Dar a cada agente su propia identidad y credenciales rotables en lugar de reutilizar la cuenta de servicio de un empleado.
  • Aislar el entorno de ejecución de un agente para que no pueda alterar sus propias restricciones aunque una inyección lo comprometa.

Preguntas frecuentes

¿Qué se rompe primero cuando falta?
Los permisos. El patrón más repetido es el agente que hereda las credenciales de la persona que lo lanzó y acaba con más acceso del que ningún humano tendría aprobado — sin que nadie lo haya decidido explícitamente.
¿Vale el pentest de siempre?
Ayuda pero no llega. La superficie nueva es el contenido que el agente lee: un documento o una web pueden llevar instrucciones que el agente ejecuta. Eso hay que probarlo con el agente corriendo y con sus herramientas conectadas, no contra un endpoint.

Términos relacionados

Fuentes y lecturas