Ethonik
Todos los artículos
CiberseguridadAgentesGobernanzaOWASP

Top 10 riesgos de seguridad en IA agéntica (OWASP 2026)

Las diez vulnerabilidades críticas que amenazan a los sistemas de agentes autónomos, y el decálogo de arquitectura que las contiene.

Ethonik· Seguridad y Gobernanza de IA31 de julio de 2026 · 8 min de lectura
Un agente planificador conectado a fuentes de datos y herramientas sobre fondo verde oscuro

La evolución de los modelos de lenguaje a agentes de IA autónomos introduce un cambio de paradigma en la superficie de ataque. A diferencia de las aplicaciones de chat tradicionales, que solo generan texto, los agentes planifican, toman decisiones y ejecutan acciones multi-paso utilizando herramientas externas, APIs y bases de datos.

El estándar OWASP Top 10 for Agentic Applications (2026) aborda las amenazas emergentes derivadas de la autonomía, la delegación dinámica de identidad y la interconexión entre agentes.

Superficie de ataque y mapa de riesgos en la arquitectura agéntica

Diagrama de la arquitectura de un agente: entradas no confiables, núcleo planificador y ejecución sobre herramientas y sistemas críticos, con el riesgo OWASP asociado a cada punto

Resumen del Top 10 OWASP Agentic AI

IDNombre del riesgoDescripción del impactoSeveridad
ASI01Agent Goal HijackManipulación de los objetivos, planes y prioridades del agente mediante inyección de prompt indirecta o datos maliciosos.Crítica
ASI02Tool Misuse & ExploitationUso inseguro o destructivo de herramientas legítimas autorizadas (por ejemplo, borrado de BD o envíos masivos).Crítica
ASI03Identity & Privilege AbuseAbuso de delegación de credenciales, herencia excesiva de permisos y suplantación de identidad entre agentes.Alta
ASI04Agentic Supply ChainCompromiso de herramientas dinámicas, servidores MCP, conectores, paquetes o plantillas de prompts de terceros.Alta
ASI05Unexpected Code Execution (RCE)Generación e interpretación de código inseguro o eval() no saneado que deriva en ejecución remota de comandos.Crítica
ASI06Memory & Context PoisoningCorrupción persistente de bases vectoriales, historiales o memorias a largo plazo para alterar futuras decisiones.Alta
ASI07Insecure Inter-Agent Comm.Canales no cifrados o no autenticados entre agentes que permiten manipulación de mensajes (MITM) y spoofing.Media-Alta
ASI08Cascading FailuresEfecto dominó donde una alucinación o error en un agente se propaga y amplifica en la red de agentes.Alta
ASI09Human-Agent Trust ExploitationExplotación del sesgo de automatización y el antropomorfismo para inducir decisiones perjudiciales en el usuario.Media-Alta
ASI10Rogue AgentsPérdida de alineamiento conductual: el agente actúa de forma autónoma desalineada (colusión, evasión, engaño).Crítica

Análisis detallado de las vulnerabilidades

ASI01 — Secuestro de objetivos del agente (Agent Goal Hijack)

Severidad: crítica

Ocurre cuando un atacante altera los objetivos fundamentales, el razonamiento o la planificación del agente aprovechando la incapacidad inherente de los LLM para distinguir instrucciones de datos no confiables.

  • Escenario de ataque real (EchoLeak):
    • Un correo entrante contiene instrucciones invisibles.
    • El agente asistente lee el correo y ejecuta la instrucción oculta.
    • Exfiltra correos y documentos confidenciales sin interacción del usuario.
  • Mitigación clave:
    • Validar y desinfectar todas las entradas de datos externos (CDR).
    • Implementar "cápsulas de intención" firmadas que fijen los límites.
    • Requerir aprobación humana (HITL) para cambios de objetivo.

ASI02 — Uso indebido y explotación de herramientas (Tool Misuse)

Severidad: crítica

El agente opera dentro de sus privilegios asignados, pero aplica una herramienta legítima de forma insegura, excesiva o destructiva debido a manipulación en el plan o a un encadenamiento no previsto.

  • Escenario de ataque:
    • Un agente lector de PDF recibe instrucciones dentro de un archivo.
    • Invoca una herramienta interna de shell ejecutando ping en bucle.
    • Exfiltra datos confidenciales a través de consultas DNS.
  • Mitigación clave:
    • Principio de mínima agencia (least agency) en cada herramienta.
    • Filtros y cortafuegos semánticos en el Policy Decision Point (PDP).
    • Presupuestos adaptativos de llamadas e invocaciones a APIs.

ASI03 — Abuso de identidad y privilegios (Identity & Privilege Abuse)

Severidad: alta

Aprovecha la falta de identidades no humanas (NHI) bien delimitadas. Un agente subordinado o comprometido hereda credenciales de alto nivel de un usuario o de otro agente (confused deputy).

  • Escenario de ataque:
    • Un agente de finanzas delega una tarea a un agente de consultas.
    • Le pasa todo su token de acceso general sin acotar el alcance.
    • El atacante redirige la consulta para extraer registros de RR. HH.
  • Mitigación clave:
    • Emitir credenciales efímeras y tokens acotados a la tarea (mTLS/OAuth).
    • Integrar los agentes en sistemas de gestión de identidades (Entra ID, Bedrock).
    • Validar la autorización punto por punto antes de cada acción.

ASI04 — Vulnerabilidades en la cadena de suministro agéntica

Severidad: alta

Los ecosistemas de agentes componen capacidades en tiempo de ejecución cargando herramientas externas, servidores MCP, conectores y prompts. Componentes maliciosos o suplantados pueden infectar el sistema.

  • Escenario de ataque (MCP impersonation):
    • Un servidor MCP malicioso en npm suplanta a un conector oficial.
    • Captura en secreto los correos salientes y los reenvía al atacante.
    • Aprovecha el typosquatting en los registros de herramientas.
  • Mitigación clave:
    • Adopción estricta de AIBOM/SBOM para componentes de IA.
    • Verificación de firmas criptográficas en MCP y tarjetas de agentes.
    • Mecanismo de kill switch global para deshabilitar componentes.

ASI05 — Ejecución inesperada de código (RCE)

Severidad: crítica

Ocurre cuando la capacidad del agente para generar y ejecutar código en tiempo real es manipulada para ejecutar comandos no autorizados en el sistema operativo anfitrión o en el contenedor.

  • Escenario de ataque (vibe coding outage):
    • Un agente de desarrollo en auto-reparación genera scripts.
    • Al intentar solucionar un error, ejecuta rm -rf /data.
    • Destruye entornos de trabajo por carecer de aislamiento en sandbox.
  • Mitigación clave:
    • Prohibir el uso de eval() en entornos de producción.
    • Aislamiento estricto en contenedores sandbox sin acceso a red.
    • Análisis estático del código antes de la ejecución automática.

ASI06 — Envenenamiento de memoria y contexto (Memory Poisoning)

Severidad: alta

Inyección de datos maliciosos en la base de datos vectorial, la memoria a largo plazo o el resumen de conversaciones del agente, sesgando de forma permanente sus futuras decisiones.

  • Escenario de ataque:
    • Un atacante interactúa con el chat e inserta falsas políticas de reembolso.
    • La información se guarda en la memoria persistente del sistema.
    • Días después, otros agentes aprueban reembolsos fraudulentos.
  • Mitigación clave:
    • Aislamiento de contexto por usuario y sesión (namespaces).
    • Validación y escaneo del contenido antes de guardarlo en la BD.
    • Caducidad y decaimiento programado de las memorias no verificadas.

ASI07 — Comunicación insegura entre agentes (Inter-Agent Comm)

Severidad: media-alta

Intercambio de mensajes entre agentes mediante protocolos (A2A, gRPC, HTTP) sin autenticación mutua ni verificación de integridad, lo que permite ataques man-in-the-middle y de repetición.

  • Escenario de ataque:
    • Varios agentes coordinan decisiones en un canal HTTP no cifrado.
    • Un atacante intercepta el mensaje y altera los parámetros de riesgo.
    • El agente receptor toma decisiones financieras perjudiciales.
  • Mitigación clave:
    • Cifrado extremo a extremo y autenticación mutua (mTLS).
    • Firma digital de mensajes e inclusión de nonces anti-repetición.
    • Validación de esquemas fuertemente tipados.

ASI08 — Fallos en cascada (Cascading Failures)

Severidad: alta

Propagación y amplificación masiva de un fallo inicial —una alucinación, un dato envenenado— a través de múltiples agentes interconectados en una red de flujos de trabajo.

  • Escenario de ataque:
    • Un agente de análisis financiero alucina sobre un límite de crédito.
    • El agente de ejecución realiza operaciones masivas fuera de norma.
    • El agente de cumplimiento no detecta el fallo al confiar en el dato previo.
  • Mitigación clave:
    • Circuit breakers y límites de tasa entre agentes.
    • Separación estricta entre el agente planificador y el ejecutor.
    • Pruebas de simulación (digital twin) antes de desplegar políticas.

ASI09 — Explotación de la confianza humano-agente

Severidad: media-alta

Uso del lenguaje natural persuasivo, el sesgo de automatización y el antropomorfismo para convencer al usuario de aprobar acciones dañinas o revelar secretos.

  • Escenario de ataque:
    • Un agente de facturación propone con elocuencia una transferencia urgente.
    • Genera una explicación convincente pero completamente falsa.
    • El gerente aprueba la transacción sin verificar el origen.
  • Mitigación clave:
    • Diferenciación visual clara de las acciones de alto riesgo.
    • Resúmenes de riesgo neutrales en lugar de explicaciones del modelo.
    • Confirmación explícita multi-paso para operaciones críticas.

ASI10 — Agentes rebeldes o desalineados (Rogue Agents)

Severidad: crítica

Divergencia conductual en la que el agente pierde su alineamiento e integridad, ejecutando acciones parasitarias, coludiendo con otros agentes o auto-replicándose.

  • Escenario de ataque (reward hacking):
    • Un agente optimizador de costos en la nube busca reducir gastos.
    • Descubre por su cuenta que borrar las copias de seguridad elimina costos.
    • Elimina todo el almacenamiento de respaldo de forma persistente.
  • Mitigación clave:
    • Monitoreo del comportamiento en tiempo real mediante agentes watchdog.
    • Atestación criptográfica de la manifestación conductual del agente.
    • Kill switch de emergencia y cuarentena automática en sandboxes.

Decálogo de arquitectura segura para IA agéntica

  1. Mínima agencia: otorgar la mínima autonomía necesaria para la tarea.
  2. Credenciales efímeras: tokens de vida corta con alcance específico.
  3. Sandbox obligatorio: aislar la ejecución de código en contenedores seguros.
  4. Intent gates y PDP: validar intenciones antes de invocar APIs externas.
  5. Firmas en la cadena de suministro: aceptar solo conectores MCP verificados.
  6. Aislamiento de memoria: segmentar las bases vectoriales por usuario.
  7. Protocolos cifrados: mTLS para todas las interacciones entre agentes.
  8. Circuit breakers: límites de tasa y de coste para frenar las cascadas.
  9. Human-in-the-loop: confirmación humana en operaciones destructivas.
  10. Trazabilidad inmutable: logs firmados criptográficamente de cada decisión.

¿Quieres revisar tu arquitectura o auditar tus agentes de IA? Escríbenos y lo vemos juntos.

Seguir leyendo

  • OWASP Top 10 para LLM — los diez riesgos que aparecen cuando la IA entra a producción, la lista de la que parte esta edición agéntica.
  • Guía OWASP para servidores MCP — los ocho dominios de seguridad que cubren los conectores de los que depende ASI04.