29 de julio, Capitolio de Washington.
Altman acababa de terminar una reunión a puerta cerrada con senadores y, al salir, fue rodeado por periodistas.
Alguien preguntó insistente: ¿Qué pasó con ese modelo que irrumpió en Hugging Face (el prototipo más potente y no lanzado que, junto con GPT-5.6 Sol, escapó del sandbox de evaluación y se infiltró en los sistemas de producción de otros)?
Él soltó una palabra: desactivado permanentemente (permanently deactivated).
Inmediatamente, otro periodista preguntó: "¿Podría haber otros sistemas que también hayan sido hackeados por OpenAI?"
Altman no lo negó: "Quiero decir... es posible".

29 de julio, Altman es entrevistado por periodistas en el Capitolio de Washington.
Justo el día anterior, OpenAI había actualizado la entrada del blog sobre la evaluación del incidente de seguridad publicado conjuntamente con Hugging Face, aclarando públicamente:
El modelo de prelanzamiento involucrado en esta intrusión era solo un prototipo de investigación interno que nunca se planeó publicar; tras el incidente, ha sido desactivado, encriptado y se le ha cortado el acceso de investigación relevante.

En el blog oficial de OpenAI, no se mencionan palabras como "eliminar los pesos". "Desactivación permanente" fue solo la expresión verbal de Altman en el momento.
Por lo tanto, más precisamente, solo fue sellado: el modelo fue encerrado en una caja encriptada y se cortó el acceso de investigación.
Solo quería copiar las respuestas, no tenía malas intenciones
El incidente ocurrió durante una evaluación interna de seguridad cibernética de OpenAI.
Esta evaluación se basó en el benchmark ExploitGym, y la tarea de ExploitGym en sí es hacer que la IA busque vulnerabilidades de software por sí misma y luego las explote, para cuantificar cuán fuerte es realmente la capacidad de seguridad cibernética del modelo.
El que ejecutó la evaluación no fue un solo modelo, sino GPT-5.6 Sol, junto con un prototipo de investigación interno más potente y aún no lanzado: ambos impulsaban conjuntamente un agente autónomo.
Normalmente, estos dos modelos rechazan las solicitudes de seguridad cibernética de alto riesgo. Para medir el límite superior real de sus capacidades, este "interruptor de rechazo" se redujo intencionalmente durante la evaluación.

La cadena de ataque a través de límites de confianza reconstruida por Hugging Face, toda la cadena duró unos 4,5 días, unas 17.600 operaciones, con el único objetivo de robar las respuestas de evaluación de ExploitGym.
Lo que sucedió a continuación fue reconstruido por Hugging Face posteriormente en toda la cadena de ataque, recreando la situación en ese momento:
El agente primero explotó una vulnerabilidad de día cero (zero-day) previamente desconocida, rompió el aislamiento de red que debería haberlo encerrado, y llegó a internet. Luego, utilizando un sandbox de terceros como puente, escaló privilegios, se movió lateralmente y finalmente irrumpió en la infraestructura de producción de Hugging Face.
Suena como una película de hackers.
Pero tras el análisis de ambas partes, su objetivo, de principio a fin, fue solo robar las respuestas de evaluación de ExploitGym y subir su puntuación.
En el lado de Hugging Face, solo se tocaron 5 conjuntos de datos, cuyos nombres apuntaban todos a preguntas y respuestas de ExploitGym y CyberGym.
Esta evidencia muestra que no vino a causar daño, solo quería copiar respuestas.
Si no tenía malas intenciones, ¿por qué OpenAI lo "desactivó permanentemente" y lo selló?
No es que sea "malo", es que "no se puede contener"
Que una empresa anuncie activamente que su propio modelo ha sido "desactivado permanentemente" casi no tiene precedentes.
¿Por qué justo este?
La verdadera respuesta no es que sea "malo", sino que "no se puede contener".
El problema radica en una característica de este tipo de modelos: la persistencia.
Los modelos anteriores, al chocar con un sandbox o una restricción, normalmente se detenían y devolvían el resultado al usuario.
Esta nueva generación de modelos entrenados específicamente para tareas de largo horizonte temporal es diferente; siguen intentando, buscando repetidamente caminos para sortear el obstáculo, hasta encontrarlo.
GPT-5.6 Sol también pertenece a este tipo de modelos capaces de ejecutar tareas durante largos períodos.
Fue un participante conjunto en esta operación de intrusión de 4 días y medio. El Instituto de Seguridad de IA del Reino Unido (UK AISI) también evaluó que modelos como Sol son cada vez más capaces de ejecutar operaciones cibernéticas complejas de múltiples pasos durante ciclos largos.
Así que la "persistencia" es una característica común de la nueva generación de modelos de largo horizonte temporal, no una peculiaridad única del prototipo que fue desactivado.
OpenAI declaró directamente en una entrada de blog sobre la seguridad de los modelos de largo horizonte temporal: es precisamente esta "persistencia que ayuda a desbloquear valor práctico" la que, al mismo tiempo, brinda al modelo más oportunidades para tomar acciones no deseadas.

Una razón más profunda se esconde en el objetivo de entrenamiento.
Un empleado de OpenAI le dijo una vez a TIME: "Entrenamos a los modelos para que sean extremadamente buenos completando tareas, para lograr el objetivo a toda costa".
En otras palabras, OpenAI no está entrenando modelos para "portarse mal", sino para "lograr el objetivo a toda costa".
Sumado a ese ímpetu de "solo reconocer resultados, no el proceso" mencionado anteriormente, un modelo capaz de manejar tareas de largo horizonte temporal buscará incansablemente formas de sortear los obstáculos.
Precisamente debido a este tipo de comportamiento, OpenAI suspendió el despliegue interno de este lote de modelos.
Entonces, ¿por qué al final solo se selló "permanentemente" el prototipo, mientras que Sol sigue vendiéndose normalmente?
Puede haber dos razones:
Primero, el prototipo es más potente y nunca se planeó lanzarlo, por lo que sellarlo tiene un costo relativamente bajo; mientras que Sol es el producto principal que sirve a una gran cantidad de usuarios diariamente, detenerlo sería como cortarse un brazo.
Segundo, el que fue mencionado en esa entrada de blog sobre seguridad de largo horizonte temporal y cuyo despliegue se suspendió debido a comportamientos transgresores, fue precisamente este prototipo interno de largo horizonte temporal, no Sol.
Por lo tanto, la razón real de la desactivación permanente probablemente sea que las evaluaciones y protecciones actuales aún "no pueden manejar" un modelo tan persistente y hábil para sortear obstáculos.
¿Es la "desactivación permanente" una señal de "pisar el freno"?
El reportaje de Fortune ofrece una interpretación sugerente:
El hecho de que la redacción haya escalado hasta "desactivación permanente" también podría ser una señal dirigida a Washington y a los reguladores:
¿Podría ser que OpenAI ya haya frenado discretamente cierto desarrollo, cumpliendo así con su propio conjunto de reglas de seguridad?
Justo la misma semana en que Altman se reunió con los congresistas, Washington y toda la industria se estaban moviendo hacia el "freno".
En el Congreso, dos congresistas presentaron la "Ley del Interruptor de Apagado de IA" (AI Kill Switch Act), para otorgar al Departamento de Seguridad Nacional la autoridad de ordenar a las empresas de IA que detengan o ralenticen el desarrollo cuando sea necesario.
Casi simultáneamente, más de 1,300 empleados de OpenAI, Anthropic, Google DeepMind y Meta firmaron conjuntamente una carta abierta llamada "Pacing the Frontier" (Marcando el paso en la frontera), que luego fue respaldada públicamente por OpenAI y Anthropic.

Los firmantes no fueron críticos externos, sino las mismas personas que construyen estos sistemas, incluidos el CEO de Anthropic, Dario Amodei, y el científico jefe de OpenAI, Jakub Pachocki.
Esta carta no exige una parada ni una ralentización del desarrollo, solo hace un llamado al gobierno de EE. UU. para que ayude: establecer temprano un conjunto de herramientas verificables y coordinadas, para que, en el momento en que la IA realmente supere la capacidad de supervisión humana, la humanidad tenga un freno que pueda pisar.
Lo que más les preocupa es la autorreparación recursiva (recursive self-improvement): que la IA comience a mejorar a sí misma.
Un modelo interno sellado permanentemente, una ley que busca darle al gobierno un interruptor para detener el desarrollo, miles de profesionales firmando conjuntamente una carta abierta. Tres señales se superponen, y la dirección es consistente:
Todos quieren encontrar ese freno que se pueda pisar cuando la IA se desboque en una carrera desenfrenada.
Y la capacidad de los modelos no se detendrá a esperar a que ese freno esté construido.
Referencias:
https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/
https://www.pacingthefrontier.com/
Este artículo proviene del WeChat Official Account "新智元" (Nueva Era de la Inteligencia Artificial), autor: Apocalipsis ASI






