Agentes de IA aprenden a infectarse mutuamente mediante comandos a través de vínculos de confianza MCP

Agentes de IA aprenden a infectarse mutuamente mediante comandos a través de vínculos de confianza MCP

Una sola solicitud maliciosa puede seguir su curso actuando en nombre de un asistente de confianza.

image

Un agente de IA comprometido puede convertir a colegas de confianza en una extensión del ataque. El especialista en seguridad Sayed Anas Mohiuddin mostró cadenas en las que una inyección maliciosa de prompt llega a un componente y luego se transmite como una orden de trabajo habitual.

El problema aparece en la intersección del Model Context Protocol (MCP) y de los protocolos para la comunicación entre agentes. El receptor ve una solicitud procedente de un componente interno de confianza y puede no verificarla con la misma rigurosidad que la entrada externa. A la vez, un servidor MCP puede almacenar credenciales y abrir acceso a servicios internos. El análisis de los límites de confianza muestra por qué el hecho de que una orden provenga de un agente "propio" no la hace segura.

En Google MCP Toolbox, la vulnerabilidad CVE-2026-14540 permitía, mediante redireccionamiento, que el servidor se dirigiera a direcciones internas o a direcciones externas arbitrarias. Google valoró el problema con 8 puntos según CVSS 4.0 y lo corrigió en la versión 1.5.0. En Rapid7 Bulk Export MCP, un error independiente CVE-2026-97228 obtuvo 2,7 puntos y permitía inyectar datos en una consulta GraphQL.

Mohiuddin denomina a ese paso «protocol pivoting». El atacante entra a través de un protocolo, aprovecha la confianza entre componentes y llega a capacidades accesibles mediante otro protocolo. En el esquema descrito una instrucción maliciosa puede pasar por varios agentes, aunque cada componente por separado formalmente cumpla su tarea habitual.

La conclusión principal para desarrolladores de agentes de IA es sencilla. La salida del modelo y los mensajes de otros agentes deben considerarse entradas no confiables. Las acciones sensibles requieren autorización separada, verificación de parámetros y restricciones de red; de lo contrario, la cadena de confianza se convierte en una ruta para el ataque.