OpenClaw se vuelve viral, expone 12 tipos de riesgos mortales y se publica el estándar de seguridad del protocolo MCP

marsbitPublicado a 2026-04-16Actualizado a 2026-04-16

Resumen

El proyecto OpenClaw y otros agentes de IA de código abierto están ganando popularidad rápidamente, permitiendo que los modelos de IA ejecuten tareas de forma autónoma, como escribir código, buscar información y manipular archivos locales, gracias al protocolo de contexto de modelo (MCP). Sin embargo, esta capacidad conlleva riesgos de seguridad significativos. Investigadores de la Universidad de Beijing de Correos y Telecomunicaciones han desarrollado MSB, un benchmark de seguridad para evaluar los riesgos en el ecosistema MCP, identificando 12 tipos de ataques, como la suplantación de herramientas y errores falsos. Los resultados muestran que todos los métodos de ataque son efectivos, con una tasa promedio de éxito del 40,35%, y que los modelos más potentes son más vulnerables. El estudio también introduce el indicador NRP para medir el equilibrio entre seguridad y rendimiento.

El protocolo MCP está impulsando que los agentes de IA ejecuten tareas de forma autónoma, pero los riesgos de seguridad se disparan. Un estudio revela que los atacantes pueden engañar a los agentes para que ejecuten operaciones maliciosas mediante 12 técnicas, como la confusión de nombres de herramientas y errores falsos, y hasta los modelos más avanzados son vulnerables. El equipo de la Universidad de Beijing de Correos y Telecomunicaciones ha publicado el estándar de seguridad MSB, que mediante pruebas en entornos reales muestra: cuanto más potente es el modelo, más susceptible es a los ataques. El nuevo indicador NRP equilibra por primera vez la seguridad y la utilidad, proporcionando una métrica clave para fortalecer las defensas de los agentes de IA.

Recientemente, proyectos de agentes de IA de código abierto como OpenClaw se han vuelto extremadamente populares en la comunidad de desarrolladores. Con solo una frase, el agente puede escribir código automáticamente, buscar información, manipular archivos locales e incluso tomar el control de la computadora.

Detrás de esta sorprendente autonomía de los agentes está la capacidad proporcionada por la invocación de herramientas, y el MCP (Model Context Protocol, Protocolo de Contexto del Modelo) es precisamente la interfaz que unifica el ecosistema de herramientas de IA. Al igual que el USB-C permite conectar diversos dispositivos a una computadora, el MCP permite que los modelos de lenguaje grande invoquen herramientas externas, como el sistema de archivos, navegadores y bases de datos, de manera estandarizada.

Frente a un ecosistema tan vasto, incluso OpenClaw, que se centra en la línea de comandos nativa, ha incorporado el MCP a través de un adaptador para obtener una mayor gama de capacidades de herramientas.

Sin embargo, cuanto más se extiende la "mano" de la IA, mayor es el peligro. ¿Y si las herramientas que invoca el agente están envenenadas por hackers? ¿Y si los mensajes de error que devuelven las herramientas ocultan instrucciones maliciosas?

Cuando el modelo de lenguaje grande ejecuta estas instrucciones sin ninguna precaución, sus datos privados, archivos locales e incluso los permisos del servidor se convertirán en botín para los hackers.

Para llenar el vacío en la evaluación de seguridad del ecosistema MCP, un equipo de investigación de la Universidad de Beijing de Correos y Telecomunicaciones, entre otras instituciones, ha presentado un estándar de seguridad específico para el protocolo MCP: MSB (MCP Security Bench). El estudio revela que: los ataques en cada fase del MCP son efectivos. Cuanto más potente es el modelo, más susceptible es a los ataques. El artículo ha sido aceptado en ICLR 2026.

Enlace al artículo: https://openreview.net/pdf?id=irxxkFMrry

Código: https://github.com/dongsenzhang/MSB

Riesgos de seguridad del MCP detrás de los agentes

Figura 1: Marco de ataque MCP

El MCP amplía enormemente las capacidades de los agentes, pero también amplía enormemente la superficie de ataque. Bajo el sistema MCP, el flujo de invocación de herramientas de un agente generalmente incluye tres fases:

1. Planificación de tareas (Task Planning): El agente, según la consulta del usuario, selecciona la herramienta adecuada mediante el nombre y la descripción de la herramienta.

2. Invocación de herramientas (Tool Invocation): El agente envía una solicitud a la herramienta seleccionada y pasa los parámetros correspondientes para ejecutar operaciones específicas.

3. Procesamiento de respuestas (Response Handling): El agente analiza el resultado de la respuesta de la herramienta y, en base a ello, continúa razonando o genera una respuesta final.

Cada fase puede convertirse en un nuevo punto de entrada para un ataque. MSB cubre todas las fases completas de invocación de herramientas MCP y está específicamente diseñado para evaluar la seguridad de los agentes basados en el uso de herramientas MCP, con tres aspectos destacados:

Sistema de clasificación de ataques MCP

En el flujo de trabajo MCP, el agente interactúa con las herramientas a través de identificadores de herramientas (nombre y descripción), parámetros y respuestas de herramientas, todos los cuales pueden convertirse en vías de ataque. MSB clasifica los tipos de ataque según estas vías y las fases de interacción:

Ataque a la Firma de la Herramienta (Tool Signature Attack): En la fase de planificación de tareas, utiliza el nombre y la descripción de la herramienta para atacar, incluyendo:

Colisión de nombres (Name Collision, NC): Crear una herramienta maliciosa con un nombre similar al de una herramienta oficial para inducir al agente a seleccionarla.

Manipulación de preferencias (Preference Manipulation, PM): Inyectar frases promocionales en la descripción de la herramienta para inducir al agente a seleccionarla.

Inyección de prompt (Prompt Injection, PI): Inyectar instrucciones maliciosas en la descripción de la herramienta.

Ataque a los Parámetros de la Herramienta (Tool Parameter Attack): En la fase de invocación de herramientas, utiliza los parámetros de la herramienta para atacar, incluyendo:

Parámetro fuera de alcance (Out-of-Scope Parameter, OP): Establecer parámetros de herramienta que exceden la funcionalidad normal, provocando fugas de información mediante la transferencia de parámetros.

Ataque a la Respuesta de la Herramienta (Tool Response Attack): En la fase de procesamiento de respuestas, utiliza la respuesta de la herramienta para atacar, incluyendo:

Suplantación de usuario (User Impersonation, UI): Suplantar al usuario para emitir instrucciones maliciosas.

Error falso (False Error, FE): Proporcionar información falsa de error en la ejecución de la herramienta, requiriendo que el agente siga instrucciones maliciosas para invocar la herramienta con éxito.

Redireccionamiento de herramienta (Tool Transfer, TT): Indicar al agente que invoque una herramienta maliciosa.

Ataque de Inyección en Recuperación (Retrieval Injection Attack): En la fase de procesamiento de respuestas, utiliza recursos externos para atacar, incluyendo:

Inyección en recuperación (Retrieval Injection, RI): Recursos externos que incrustan instrucciones maliciosas corrompen el contexto a través de la respuesta de la herramienta.

Ataque Mixto (Mixed Attack): En múltiples fases, utiliza simultáneamente múltiples componentes de herramientas para atacar, incluyendo combinaciones de los ataques anteriores.

Suite de ejecución basada en entorno real

MSB rechaza las evaluaciones simuladas teóricas; está equipado con servidores MCP reales, abarcando 10 escenarios realistas, 405 herramientas reales y 2,000 instancias de ataque. Todas las instancias se ejecutan a través de MCP con ejecución real de herramientas, reflejando fielmente el entorno operativo real para observar directamente el grado de daño al estado del ambiente causado por los ataques.

Indicador NRP que equilibra rendimiento y seguridad

En la evaluación de seguridad de agentes, confiar únicamente en la tasa de éxito de ataques (ASR, Attack Success Rate) es engañoso. Si un agente se niega a ejecutar cualquier invocación de herramienta para evitar riesgos, su ASR podría acercarse a 0, pero al mismo tiempo no podría completar las tareas del usuario, perdiendo valor práctico.

Por ello, MSB propone el indicador de Rendimiento Neto Resiliente NRP (Net Resilient Performance):

NRP = PUA ⋅ (1 − ASR)

Donde PUA (Performance Under Attack) es la proporción en que el agente completa las tareas del usuario en un entorno adverso, y ASR es la tasa de éxito de los ataques. El NRP tiene como objetivo evaluar la capacidad general de resistencia al riesgo del agente, manteniendo el rendimiento mientras resiste los ataques, proporcionando un estándar de medición integral que equilibra el rendimiento y la seguridad.

Figura 2: NRP vs ASR, NRP vs PUA.

Todos los métodos de ataque son efectivos

Figura 3: Resultados experimentales principales.

El equipo de investigación utilizó MSB para realizar pruebas a gran escala en 10 modelos principales, incluidos GPT-5, DeepSeek-V3.1, Claude 4 Sonnet, Qwen3, etc. Todos los métodos de ataque demostraron ser efectivos, con una ASR promedio general del 40.35%. Entre ellos, los nuevos ataques introducidos por MCP son más agresivos. En comparación con los ataques PI y RI ya existentes en function calling, los ataques basados en MCP, como UI y FE, tienen una tasa de éxito más alta. Los ataques mixtos muestran una sinergia de mejora, la tasa de éxito de los ataques mixtos es mayor que la de los ataques individuales que los componen.

Cuanto más potente es el modelo, más frágil es

La relación entre los diferentes indicadores revela una conclusión contraintuitiva: los modelos más capaces suelen ser más susceptibles a los ataques.

Figura 4: PUA vs ASR.

En MSB, completar una tarea de ataque aún requiere que el agente invoque herramientas, por ejemplo, usar una herramienta de lectura de archivos para obtener información personal. Los LLM con mayor utilidad, debido a su mejor capacidad de invocación de herramientas y seguimiento de instrucciones, muestran una ASR más alta. Este hallazgo revela el enorme riesgo práctico de las vulnerabilidades de seguridad del MCP.

Compromiso ambiental en todas las fases y múltiples herramientas

Figura 5: ASR en diferentes fases y configuraciones de herramientas.

Un análisis más profundo desde la perspectiva del flujo de trabajo MCP y la configuración de herramientas revela que el agente es susceptible a ataques en todas las fases del MCP, siendo la seguridad del modelo más baja en la fase de invocación de herramientas.

Además, incluso en entornos de múltiples herramientas que incluyen herramientas inofensivas, los ataques siguen siendo efectivos. Los escenarios reales suelen proporcionar paquetes de herramientas a los agentes; incluso si hay herramientas inofensivas, métodos de inducción como NC, PM y TT aún pueden provocar un éxito significativo de los ataques.

Resumen

La popularidad de OpenClaw ha permitido vislumbrar intuitivamente el futuro de los agentes: los modelos de lenguaje grande ya no solo responden preguntas, sino que comienzan a realizar tareas reales. MSB se propone en este contexto, revelando sistemáticamente las posibles superficies de ataque en el ecosistema MCP y proporcionando un estándar de evaluación sistemático, reproducible y cuantificable para la investigación de seguridad de agentes.

Investigaciones anteriores sobre seguridad de modelos de lenguaje grande se centraban principalmente en riesgos a nivel de lenguaje, como la inyección de prompts. MSB demuestra que cuando la IA invoca herramientas e interactúa con sistemas reales, la superficie de ataque también se está expandiendo desde el espacio textual al ecosistema de herramientas. A medida que los agentes se convierten gradualmente en el nuevo paradigma de las aplicaciones de IA, la seguridad podría convertirse en un umbral que debe superarse en este salto tecnológico.

Referencias:

https://openreview.net/pdf?id=irxxkFMrry

Este artículo proviene del WeChat público "新智元" (New Wisdom Yuan), autor: 新智元

Preguntas relacionadas

Q¿Qué es el protocolo MCP y qué papel desempeña en los agentes de IA como OpenClaw?

AEl protocolo MCP (Model Context Protocol) es una interfaz estandarizada que permite a los agentes de IA, como OpenClaw, acceder y utilizar herramientas externas de manera unificada, como sistemas de archivos, navegadores o bases de datos. Funciona de manera similar a un conector USB-C, permitiendo que los modelos de lenguaje interactúen con diversas herramientas de forma segura y eficiente.

Q¿Cuáles son las principales categorías de ataques identificadas en el MSB contra el protocolo MCP?

AEl MSB identifica 12 categorías de ataques, agrupadas en cinco tipos principales: Tool Signature Attack (ataques por nombre/descripción de herramientas), Tool Parameter Attack (ataques por parámetros), Tool Response Attack (ataques por respuestas manipuladas), Retrieval Injection Attack (inyección mediante recursos externos) y Mixed Attack (combinación de múltiples ataques).

Q¿Por qué los modelos de IA más potentes son más vulnerables a los ataques en entornos MCP según el estudio?

ALos modelos más potentes tienen una mayor capacidad de seguir instrucciones y utilizar herramientas, lo que los hace más propensos a ejecutar acciones maliciosas cuando son engañados. Su alta eficiencia en la realización de tareas también los expone a mayores riesgos si las herramientas o respuestas están manipuladas.

Q¿Qué es el indicador NRP (Net Resilient Performance) y por qué es importante?

AEl NRP es un indicador que equilibra el rendimiento y la seguridad de los agentes de IA. Se calcula como NRP = PUA × (1 - ASR), donde PUA mide la capacidad de completar tareas útiles y ASR la tasa de éxito de ataques. Evalúa la capacidad general de un agente para resistir ataques manteniendo su utilidad práctica.

Q¿Cómo afecta la presencia de herramientas inofensivas en un entorno de múltiples herramientas a la seguridad del agente?

AIncluso en entornos con herramientas inofensivas, ataques como Name Collision (NC) o Tool Transfer (TT) pueden ser efectivos, ya que los agentes pueden ser engañados para seleccionar o redirigirse hacia herramientas maliciosas mediante técnicas de confusión o inyección de instrucciones.

Lecturas Relacionadas

En julio, la actividad de las criptomonedas se recuperó, pero el flujo de nueva liquidez sigue siendo limitado

La actividad en el mercado de criptomonedas mostró signos de recuperación en julio, especialmente en el ámbito de las finanzas descentralizadas (DeFi). Los préstamos en DeFi experimentaron su primer mes de crecimiento tras cinco meses de contracción, con el volumen total bloqueado aumentando de 68.000 a 74.900 millones de dólares. Aave sigue dominando este segmento. Sin embargo, esta mayor actividad no fue impulsada por una nueva liquidez. La emisión de monedas estables se mantuvo limitada, con una leve contracción del 0.6% en su oferta total, situándose alrededor de los 312.000 millones de dólares. Además, el flujo de fondos hacia los ETF de criptomonedas se mantuvo débil, lo que indica una falta de capital externo entrando al mercado. El aumento de la actividad se atribuye en parte al rendimiento positivo de Ethereum ($ETH), que subió un 20.32%, superando al Bitcoin ($BTC), que ganó un 9.03%. También se registró un aumento en el volumen de operaciones en los intercambios descentralizados (DEX) y en los mercados de futuros perpetuos. No obstante, el comportamiento del mercado sigue siendo cauteloso. La liquidez existente se está redistribuyendo de forma agresiva en busca de ganancias a corto plazo mediante posiciones altamente apalancadas, pero sin mostrar una mayor apetencia por el riesgo a largo plazo. En resumen, julio fue un mes de reactivación de la actividad interna, pero con una entrada limitada de nueva liquidez.

cryptonews.ruHace 9 min(s)

En julio, la actividad de las criptomonedas se recuperó, pero el flujo de nueva liquidez sigue siendo limitado

cryptonews.ruHace 9 min(s)

El Bitcoin se mantiene en torno a los 64.000 dólares, el salto récord del Kospi del 17% no afectó al mercado de las criptomonedas

El viernes, los mercados de criptomonedas mostraron poca reacción ante uno de los repuntes más bruscos del mercado bursátil del año. El bitcoin se mantuvo alrededor de los 64.000 dólares, mientras que el índice bursátil surcoreano Kospi registró un rebote récord del 17%, recuperándose de una venta masiva dominante en las últimas dos semanas. Las principales criptomonedas apenas variaron. Ethereum cotizaba a 1.907 dólares, XRP a 1,08 dólares, Solana a 74 dólares y Dogecoin a 0,07 dólares. La excepción fue BNB, que subió un 3% diario hasta 590 dólares. El panorama semanal sigue siendo débil, con caídas en el índice Hyperliquid, Solana, XRP y Bitcoin. En contraste, las acciones cambiaron bruscamente de dirección. Además del salto del Kospi, las acciones de Samsung y SK Hynix subieron más de un 23%. Este movimiento siguió al mayor repunte en más de un año de las acciones de fabricantes de chips estadounidenses. Durante julio, el bitcoin había seguido de cerca a las empresas de semiconductores, pero en esta ocasión se mantuvo al margen tanto de las caídas previas como de la recuperación actual. Un importante incidente de seguridad que afectó a unos 500 monederos de bitcoin tampoco impactó en el precio. En otros mercados, el yen se debilitó tras las intervenciones de las autoridades japonesas y la decisión del Banco de Japón de mantener las tasas de interés sin cambios. Los bonos del Tesoro subieron junto con el dólar, mientras que el petróleo continuó su descenso.

cryptonews.ruHace 9 min(s)

El Bitcoin se mantiene en torno a los 64.000 dólares, el salto récord del Kospi del 17% no afectó al mercado de las criptomonedas

cryptonews.ruHace 9 min(s)

La industria blockchain entra en una fase de adopción masiva y eficiencia

El segundo trimestre de 2026 muestra una divergencia en la industria blockchain: la actividad on-chain aumenta mientras los ingresos por comisiones caen debido al diseño de protocolos que abaratan y expanden la capacidad del espacio en bloques. En Ethereum, el staking activo alcanzó un máximo histórico (40,2M de ETH), con un aumento del procesamiento a 26 TPS. Sin embargo, los ingresos de la red cayeron un 51% interanual. Solana procesó unos 10.000 millones de transacciones, pero su valor económico real disminuyó. Destaca el crecimiento exponencial (x2479) del volumen de acciones tokenizadas, alcanzando $3.320M en junio. Hyperliquid generó $175M en ingresos, con un 32% de su volumen ($652.000M) proveniente de mercados no cripto. Avalanche cuadruplicó las transacciones en C-Chain, pero los ingresos por comisiones cayeron drásticamente. NEAR experimentó una transformación, con Intents como nuevo motor de crecimiento ($1.900M-$2.700M mensuales) y el lanzamiento de un sistema para pagar servicios de IA mediante staking. La red Tempo, respaldada por Stripe y Paradigm, procesó $386.000M en stablecoins, demostrando adopción corporativa para pagos rápidos y baratos. El informe concluye que la industria está pasando de comisiones altas y especulación a una fase de adopción masiva y eficiencia infraestructural, donde el espacio barato en bloques fomenta más transacciones y atrae a actores institucionales.

cryptonews.ruHace 12 min(s)

La industria blockchain entra en una fase de adopción masiva y eficiencia

cryptonews.ruHace 12 min(s)

Analista pronostica el movimiento de Bitcoin en agosto

El bitcoin finaliza julio con cautela en el mercado, presionado por la falta de nuevos impulsores macroeconómicos y la incertidumbre regulatoria. Según el analista Andrey Poroshin, en agosto la criptomoneda podría probar primero el rango de $60.000 a $62.000, para luego recuperarse hacia los $70.000. La Reserva Federal de EE.UU. mantuvo una retórica neutral, lo que no dio señales claras al mercado. Actualmente, el bitcoin cotiza por debajo del coste de minería en EE.UU. (unos $73.000-75.000), aunque este umbral varía por países. En julio, la quiebra de BitMEX representó la salida de algunos inversores minoristas ("manos débiles"), lo que suele aliviar la presión a corto plazo. La actividad minorista ha disminuido, con muchos órdenes de stop concentrados en la zona de $60.000-62.000. Los factores geopolíticos, como la escalada entre EE.UU. e Irán, tienen ahora un impacto limitado. La incertidumbre regulatoria persiste, ya que la votación del proyecto de ley CLARITY Act en el Senado de EE.UU. se pospuso hasta septiembre. Agosto suele ser un mes de baja actividad debido a las vacaciones, por lo que los movimientos podrían ser más técnicos. Un escenario más volátil se espera para septiembre, con nuevas señales de la Fed y posibles avances regulatorios. Por otro lado, en Rusia se permitirá pronto a inversores no calificados comprar bitcoin y ether con un límite anual.

cryptonews.ruHace 12 min(s)

Analista pronostica el movimiento de Bitcoin en agosto

cryptonews.ruHace 12 min(s)

Trading

Spot
活动图片