Por 720 dólares se descubre la cadena de pensamiento original Opus que A Society mantenía oculta, también fue filtrada por Haiku, y GPT/Gemini también se ven afectados
Investigadores han descubierto una vulnerabilidad que permite extraer las cadenas de pensamiento (CoT) ocultas de modelos de lenguaje grandes (LLM) propietarios, como el Claude Opus 4.8 de Anthropic, el GPT-5.6 Sol de OpenAI y el Gemini 3.1 Pro de Google. El método, detallado en el artículo "Stealing Reasoning Traces from Proprietary LLM APIs", es sorprendentemente simple: no requiere hackear servidores ni descifrar algoritmos, sino que aprovecha el hecho de que estos modelos devuelven bloques de razonamiento encriptados al cliente para mantener el estado de la conversación.
El problema radica en que estos bloques encriptados, diseñados para proteger el proceso interno de pensamiento del modelo, utilizan una única clave global para toda la familia de modelos de una empresa. Esto permite que un modelo más pequeño y económico de la misma compañía (como Haiku 4.5 para Anthropic, GPT-5.6 Luna para OpenAI o Gemini Robotics 1.6 para Google) pueda "leer" y repetir el CoT oculto generado por el modelo flagship cuando se le presenta el bloque encriptado con un prompt específico.
Esta falla conlleva múltiples riesgos:
1. **Distilación de modelos:** Permite extraer masivamente CoT de modelos avanzados a un costo muy bajo (aproximadamente 720 USD por 10,000 trayectorias), lo que podría usarse para crear modelos competidores.
2. **Filtración de información sensible:** Al analizar registros públicos de agentes de IA, los investigadores recuperaron más de 315,000 fragmentos de razonamiento oculto, encontrando claves API, contraseñas, correos electrónicos y tokens de acceso que se creían eliminados.
3. **Elusión de mecanismos de seguridad:** Un modelo puede negarse a responder una pregunta peligrosa en su salida final, pero su CoT interno podría contener un análisis detallado de la misma, que queda expuesto.
4. **Inyección de instrucciones maliciosas:** Es posible incrustar comandos ocultos en el bloque de razonamiento, haciendo que el modelo ejecute acciones no deseadas en conversaciones posteriores.
Los investigadores validaron la fidelidad de los CoT extraídos comparando la longitud en tokens del texto recuperado con la facturación reportada por la API, encontrando una correlación casi perfecta. Tras una divulgación responsable, los principales proveedores (Anthropic, OpenAI, Google) han parcheado la vulnerabilidad. Sin embargo, el estudio señala que se trata de un dilema estructural entre la comodidad de reutilizar bloques de contexto y la seguridad. El artículo también incluye experimentos que no encontraron evidencia clara de que modelos de código abierto como DeepSeek hayan sido destilados a partir de los CoT filtrados de estos modelos cerrados.
marsbitHace 5 min(s)