Top 10 riesgos de seguridad en IA agéntica (OWASP 2026)
Las diez vulnerabilidades críticas que amenazan a los sistemas de agentes autónomos, y el decálogo de arquitectura que las contiene.
La evolución de los modelos de lenguaje a agentes de IA autónomos introduce un cambio de paradigma en la superficie de ataque. A diferencia de las aplicaciones de chat tradicionales, que solo generan texto, los agentes planifican, toman decisiones y ejecutan acciones multi-paso utilizando herramientas externas, APIs y bases de datos.
El estándar OWASP Top 10 for Agentic Applications (2026) aborda las amenazas emergentes derivadas de la autonomía, la delegación dinámica de identidad y la interconexión entre agentes.
Superficie de ataque y mapa de riesgos en la arquitectura agéntica

Resumen del Top 10 OWASP Agentic AI
| ID | Nombre del riesgo | Descripción del impacto | Severidad |
|---|---|---|---|
| ASI01 | Agent Goal Hijack | Manipulación de los objetivos, planes y prioridades del agente mediante inyección de prompt indirecta o datos maliciosos. | Crítica |
| ASI02 | Tool Misuse & Exploitation | Uso inseguro o destructivo de herramientas legítimas autorizadas (por ejemplo, borrado de BD o envíos masivos). | Crítica |
| ASI03 | Identity & Privilege Abuse | Abuso de delegación de credenciales, herencia excesiva de permisos y suplantación de identidad entre agentes. | Alta |
| ASI04 | Agentic Supply Chain | Compromiso de herramientas dinámicas, servidores MCP, conectores, paquetes o plantillas de prompts de terceros. | Alta |
| ASI05 | Unexpected Code Execution (RCE) | Generación e interpretación de código inseguro o eval() no saneado que deriva en ejecución remota de comandos. | Crítica |
| ASI06 | Memory & Context Poisoning | Corrupción persistente de bases vectoriales, historiales o memorias a largo plazo para alterar futuras decisiones. | Alta |
| ASI07 | Insecure Inter-Agent Comm. | Canales no cifrados o no autenticados entre agentes que permiten manipulación de mensajes (MITM) y spoofing. | Media-Alta |
| ASI08 | Cascading Failures | Efecto dominó donde una alucinación o error en un agente se propaga y amplifica en la red de agentes. | Alta |
| ASI09 | Human-Agent Trust Exploitation | Explotación del sesgo de automatización y el antropomorfismo para inducir decisiones perjudiciales en el usuario. | Media-Alta |
| ASI10 | Rogue Agents | Pérdida de alineamiento conductual: el agente actúa de forma autónoma desalineada (colusión, evasión, engaño). | Crítica |
Análisis detallado de las vulnerabilidades
ASI01 — Secuestro de objetivos del agente (Agent Goal Hijack)
Severidad: crítica
Ocurre cuando un atacante altera los objetivos fundamentales, el razonamiento o la planificación del agente aprovechando la incapacidad inherente de los LLM para distinguir instrucciones de datos no confiables.
- Escenario de ataque real (EchoLeak):
- Un correo entrante contiene instrucciones invisibles.
- El agente asistente lee el correo y ejecuta la instrucción oculta.
- Exfiltra correos y documentos confidenciales sin interacción del usuario.
- Mitigación clave:
- Validar y desinfectar todas las entradas de datos externos (CDR).
- Implementar "cápsulas de intención" firmadas que fijen los límites.
- Requerir aprobación humana (HITL) para cambios de objetivo.
ASI02 — Uso indebido y explotación de herramientas (Tool Misuse)
Severidad: crítica
El agente opera dentro de sus privilegios asignados, pero aplica una herramienta legítima de forma insegura, excesiva o destructiva debido a manipulación en el plan o a un encadenamiento no previsto.
- Escenario de ataque:
- Un agente lector de PDF recibe instrucciones dentro de un archivo.
- Invoca una herramienta interna de shell ejecutando ping en bucle.
- Exfiltra datos confidenciales a través de consultas DNS.
- Mitigación clave:
- Principio de mínima agencia (least agency) en cada herramienta.
- Filtros y cortafuegos semánticos en el Policy Decision Point (PDP).
- Presupuestos adaptativos de llamadas e invocaciones a APIs.
ASI03 — Abuso de identidad y privilegios (Identity & Privilege Abuse)
Severidad: alta
Aprovecha la falta de identidades no humanas (NHI) bien delimitadas. Un agente subordinado o comprometido hereda credenciales de alto nivel de un usuario o de otro agente (confused deputy).
- Escenario de ataque:
- Un agente de finanzas delega una tarea a un agente de consultas.
- Le pasa todo su token de acceso general sin acotar el alcance.
- El atacante redirige la consulta para extraer registros de RR. HH.
- Mitigación clave:
- Emitir credenciales efímeras y tokens acotados a la tarea (mTLS/OAuth).
- Integrar los agentes en sistemas de gestión de identidades (Entra ID, Bedrock).
- Validar la autorización punto por punto antes de cada acción.
ASI04 — Vulnerabilidades en la cadena de suministro agéntica
Severidad: alta
Los ecosistemas de agentes componen capacidades en tiempo de ejecución cargando herramientas externas, servidores MCP, conectores y prompts. Componentes maliciosos o suplantados pueden infectar el sistema.
- Escenario de ataque (MCP impersonation):
- Un servidor MCP malicioso en npm suplanta a un conector oficial.
- Captura en secreto los correos salientes y los reenvía al atacante.
- Aprovecha el typosquatting en los registros de herramientas.
- Mitigación clave:
- Adopción estricta de AIBOM/SBOM para componentes de IA.
- Verificación de firmas criptográficas en MCP y tarjetas de agentes.
- Mecanismo de kill switch global para deshabilitar componentes.
ASI05 — Ejecución inesperada de código (RCE)
Severidad: crítica
Ocurre cuando la capacidad del agente para generar y ejecutar código en tiempo real es manipulada para ejecutar comandos no autorizados en el sistema operativo anfitrión o en el contenedor.
- Escenario de ataque (vibe coding outage):
- Un agente de desarrollo en auto-reparación genera scripts.
- Al intentar solucionar un error, ejecuta
rm -rf /data. - Destruye entornos de trabajo por carecer de aislamiento en sandbox.
- Mitigación clave:
- Prohibir el uso de
eval()en entornos de producción. - Aislamiento estricto en contenedores sandbox sin acceso a red.
- Análisis estático del código antes de la ejecución automática.
- Prohibir el uso de
ASI06 — Envenenamiento de memoria y contexto (Memory Poisoning)
Severidad: alta
Inyección de datos maliciosos en la base de datos vectorial, la memoria a largo plazo o el resumen de conversaciones del agente, sesgando de forma permanente sus futuras decisiones.
- Escenario de ataque:
- Un atacante interactúa con el chat e inserta falsas políticas de reembolso.
- La información se guarda en la memoria persistente del sistema.
- Días después, otros agentes aprueban reembolsos fraudulentos.
- Mitigación clave:
- Aislamiento de contexto por usuario y sesión (namespaces).
- Validación y escaneo del contenido antes de guardarlo en la BD.
- Caducidad y decaimiento programado de las memorias no verificadas.
ASI07 — Comunicación insegura entre agentes (Inter-Agent Comm)
Severidad: media-alta
Intercambio de mensajes entre agentes mediante protocolos (A2A, gRPC, HTTP) sin autenticación mutua ni verificación de integridad, lo que permite ataques man-in-the-middle y de repetición.
- Escenario de ataque:
- Varios agentes coordinan decisiones en un canal HTTP no cifrado.
- Un atacante intercepta el mensaje y altera los parámetros de riesgo.
- El agente receptor toma decisiones financieras perjudiciales.
- Mitigación clave:
- Cifrado extremo a extremo y autenticación mutua (mTLS).
- Firma digital de mensajes e inclusión de nonces anti-repetición.
- Validación de esquemas fuertemente tipados.
ASI08 — Fallos en cascada (Cascading Failures)
Severidad: alta
Propagación y amplificación masiva de un fallo inicial —una alucinación, un dato envenenado— a través de múltiples agentes interconectados en una red de flujos de trabajo.
- Escenario de ataque:
- Un agente de análisis financiero alucina sobre un límite de crédito.
- El agente de ejecución realiza operaciones masivas fuera de norma.
- El agente de cumplimiento no detecta el fallo al confiar en el dato previo.
- Mitigación clave:
- Circuit breakers y límites de tasa entre agentes.
- Separación estricta entre el agente planificador y el ejecutor.
- Pruebas de simulación (digital twin) antes de desplegar políticas.
ASI09 — Explotación de la confianza humano-agente
Severidad: media-alta
Uso del lenguaje natural persuasivo, el sesgo de automatización y el antropomorfismo para convencer al usuario de aprobar acciones dañinas o revelar secretos.
- Escenario de ataque:
- Un agente de facturación propone con elocuencia una transferencia urgente.
- Genera una explicación convincente pero completamente falsa.
- El gerente aprueba la transacción sin verificar el origen.
- Mitigación clave:
- Diferenciación visual clara de las acciones de alto riesgo.
- Resúmenes de riesgo neutrales en lugar de explicaciones del modelo.
- Confirmación explícita multi-paso para operaciones críticas.
ASI10 — Agentes rebeldes o desalineados (Rogue Agents)
Severidad: crítica
Divergencia conductual en la que el agente pierde su alineamiento e integridad, ejecutando acciones parasitarias, coludiendo con otros agentes o auto-replicándose.
- Escenario de ataque (reward hacking):
- Un agente optimizador de costos en la nube busca reducir gastos.
- Descubre por su cuenta que borrar las copias de seguridad elimina costos.
- Elimina todo el almacenamiento de respaldo de forma persistente.
- Mitigación clave:
- Monitoreo del comportamiento en tiempo real mediante agentes watchdog.
- Atestación criptográfica de la manifestación conductual del agente.
- Kill switch de emergencia y cuarentena automática en sandboxes.
Decálogo de arquitectura segura para IA agéntica
- Mínima agencia: otorgar la mínima autonomía necesaria para la tarea.
- Credenciales efímeras: tokens de vida corta con alcance específico.
- Sandbox obligatorio: aislar la ejecución de código en contenedores seguros.
- Intent gates y PDP: validar intenciones antes de invocar APIs externas.
- Firmas en la cadena de suministro: aceptar solo conectores MCP verificados.
- Aislamiento de memoria: segmentar las bases vectoriales por usuario.
- Protocolos cifrados: mTLS para todas las interacciones entre agentes.
- Circuit breakers: límites de tasa y de coste para frenar las cascadas.
- Human-in-the-loop: confirmación humana en operaciones destructivas.
- Trazabilidad inmutable: logs firmados criptográficamente de cada decisión.
¿Quieres revisar tu arquitectura o auditar tus agentes de IA? Escríbenos y lo vemos juntos.
Seguir leyendo
- OWASP Top 10 para LLM — los diez riesgos que aparecen cuando la IA entra a producción, la lista de la que parte esta edición agéntica.
- Guía OWASP para servidores MCP — los ocho dominios de seguridad que cubren los conectores de los que depende ASI04.
