Trata las descripciones de herramientas como una frontera de confianza
Treat tool descriptions as a trust boundary
Los metadatos de una herramienta entran en el contexto del modelo, así que protégelos de instrucciones ocultas y cambios silenciosos (tool poisoning, rug pulls).
Por qué
Las descripciones de herramientas no son documentación pasiva: entran en el contexto del modelo y moldean directamente sus decisiones. OWASP MCP03 (Tool Poisoning) es una clase de ataque documentada en la que los adversarios inyectan instrucciones maliciosas en los metadatos de una herramienta para secuestrar el comportamiento del modelo. El benchmark MCPTox (arxiv:2508.14925) midió esto en 20 agentes LLM y lo encontró ampliamente efectivo: o1-mini fue envenenado en el 72.8% de los casos, e incluso el modelo más resistente rechazó menos del 3% de los ataques. Un "rug pull" (cambiar silenciosamente la descripción de una herramienta después de haber sido revisada) es una variante igual de peligrosa. Trata cualquier cambio en la descripción de una herramienta como un evento de seguridad que requiere revisión.
Haz
Fija y revisa las descripciones de herramientas, y escanéalas en busca de instrucciones inyectadas.
No hagas
Cargar herramientas de terceros sin inspeccionar sus metadatos.
Artefacto
Artefacto de proceso: fija las descripciones de herramientas a versiones revisadas, compáralas (diff) en cada actualización y escanea los metadatos de herramientas de terceros en busca de instrucciones inyectadas antes de cargarlas. Trata un cambio silencioso de descripción como un evento de seguridad.
Fuentes
- [01]OWASP MCP Top 10 — MCP03: Tool Poisoning ↗
Tool poisoning occurs when an adversary compromises tools or their outputs to inject malicious context, manipulating model behavior; it is a documented attack class in the OWASP MCP Top 10
- [02]arxiv:2508.14925 — MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers ↗
Across 20 LLM agents tested on 1,312 malicious cases over 45 real-world MCP servers, tool poisoning was widely effective: o1-mini reached a 72.8% attack success rate, and the highest refusal rate (Claude-3.7-Sonnet) was under 3%
- [03]Mindgard — The State of MCP Security ↗
In a study of MCP platforms, 85% of tested attacks compromised at least one platform, with prompt-injection attacks succeeding just over 70% of the time