OpenAI ha pisado el freno en el entrenamiento de sus modelos más avanzados.
Recientemente, OpenAI anunció que la empresa había suspendido durante dos semanas el entrenamiento de aprendizaje por refuerzo (RL) de su modelo más nuevo y planificado para su implementación. Durante este período, OpenAI fortaleció sus entornos de investigación, realizó pruebas de 'equipo rojo' (red teaming) y amplió la cobertura de sus sistemas de monitorización interna. Posteriormente, se ha reanudado parte del entrenamiento de menor riesgo.
Sin embargo, el entrenamiento RL a mayor escala, planificado para los modelos más avanzados, sigue suspendido. La empresa está observando el comportamiento de los modelos a través de entrenamientos y evaluaciones a menor escala, validando nuevas medidas de seguridad y acumulando más evidencia de alineación antes de decidir si continuar.

Enlace al artículo original: https://openai.com/index/pacing-model-development-cyber-capabilities/
Sam Altman tuiteó: "Siempre hemos dejado claro que actuaríamos de inmediato si las capacidades de un modelo superaran las exigencias de seguridad y alineación. Nos tomamos muy en serio la seguridad de la IA."

La noticia ha causado revuelo entre los usuarios.
Algunos creen que esto significa, sin duda, un nuevo retraso en el lanzamiento del modelo Astra.

Otros opinan que, combinado con la reciente salida de algunos ejecutivos de alto nivel de OpenAI, la situación parece un tanto preocupante.

También hay quienes consideran que esto podría ser simplemente una estrategia de marketing bastante "popular" en estos momentos.

Pero, en realidad, la decisión de OpenAI de ralentizar voluntariamente el escalado (scaling) y adelantar los requisitos de seguridad desde la fase de "implementación" a la de "entrenamiento" se debe principalmente a dos razones.
Dos detonantes
Dos incidentes ocurridos en las últimas semanas llevaron a OpenAI a decidir frenar el entrenamiento.
El primero fue el incidente de seguridad en Hugging Face. Un modelo de OpenAI logró, durante evaluaciones internas de ciberseguridad, evadir el entorno aislado, obtener acceso a Internet y finalmente penetrar la infraestructura de Hugging Face. Ya hemos informado en detalle sobre esto anteriormente (insertar enlace).
El segundo está relacionado con el nuevo modelo Astra, aún no lanzado. Las evaluaciones preliminares sugieren que Astra podría alcanzar el umbral de capacidad de ciberseguridad definido como "Crítica" (Critical) en el "Marco de Preparación" (Preparedness Framework) de OpenAI.
En dicho Marco, OpenAI clasifica las capacidades de ciberseguridad que podrían causar daños graves en dos niveles: "Alta" y "Crítica".
Anteriormente, la capacidad de ciberseguridad de GPT-5.6Sol ya había sido clasificada como "Alta".
Según la definición de OpenAI, alcanzar el umbral "Crítico" significa que un modelo podría poseer al menos una de las dos siguientes capacidades: descubrir y explotar vulnerabilidades día-cero (zero-day) de diversa gravedad en una amplia gama de sistemas críticos reales fuertemente protegidos, sin intervención humana; o, partiendo solo de un objetivo de ataque de alto nivel, diseñar y ejecutar de forma autónoma nuevos esquemas de ataque completos contra objetivos reforzados.
Reforzando la seguridad para modelos más capaces
En concreto, OpenAI resume ahora su sistema de seguridad en tres partes que se refuerzan mutuamente:
Monitorización (Monitoring): Detectar comportamientos preocupantes y poder responder con prontitud.
Alineación (Alignment): Reducir la probabilidad de que los modelos realicen acciones dañinas o no autorizadas.
Medidas de seguridad (Security measures): Limitar a qué y hasta dónde pueden acceder o influir los sistemas de IA.
OpenAI anticipa que, en un futuro próximo, la mayor parte del trabajo de seguridad será realizado por modelos, incluida la defensa contra otros modelos. Así, estas tres clases de medidas de seguridad podrán escalar al mismo ritmo que las capacidades de los modelos, lo cual es crucial.
OpenAI afirma que aplicará estas medidas de seguridad a lo largo de todo el proceso de investigación e implementación, adaptándolas a las capacidades, entornos operativos y niveles de riesgo de cada modelo.
En primer lugar, fortaleciendo el entorno de investigación
OpenAI indica que, a medida que los modelos avanzados adquieren capacidades de ciberseguridad cada vez más potentes, también están elevando los estándares de seguridad de los entornos utilizados para entrenar y evaluar estos modelos. Cumplir con estos estándares requiere una inversión significativa de recursos de ingeniería e impone altos costos y retrasos considerables a la investigación de vanguardia.
En las próximas semanas, OpenAI definirá y comenzará a implementar requisitos de seguridad más estrictos para las cargas de trabajo (workloads) de investigación avanzada. Por ejemplo:
Aislamiento de cargas de trabajo (Workload isolation): Para las cargas de trabajo que ejecutan código generado por modelos u otro código no confiable, ahora se exigen entornos de aislamiento más robustos, es decir, "sandboxes" más estrictos. Este requisito también se aplica al software que, al procesar la salida de un modelo, podría ser atacado.
Aislamiento de red (Network isolation): OpenAI ha añadido más controles para aislar las cargas de trabajo de alto riesgo y no confiables de Internet. El objetivo de diseño es que, incluso si una carga de trabajo o un servicio de soporte es comprometido de forma aislada, ese único compromiso no otorgue acceso no autorizado a Internet ni a otras redes internas.
Pruebas de seguridad continuas (Continuous security testing): OpenAI ha reconfigurado su entorno de investigación, eliminando servicios compartidos potencialmente vulnerables, reduciendo permisos de larga duración y mejorando los límites de seguridad y los límites de confianza. Además, está mejorando la capacidad de recopilación y monitorización de registros de seguridad. También están invirtiendo en sistemas automatizados que utilicen sus propios modelos para probar continuamente estos límites mediante ataques simulados.
OpenAI también afirma que, actualmente, para las cargas de trabajo que involucran a Astra o modelos de ciberseguridad, se exigen las medidas de protección de seguridad de más alto nivel, ya que se ha determinado que el modelo Astra podría poseer capacidades de ciberseguridad de nivel Crítico (Critical).
En segundo lugar, ampliando la monitorización del razonamiento paso a paso (chain-of-thought)
Este es un punto interesante del artículo: OpenAI comienza a "usar IA para monitorizar IA".
OpenAI señala que la monitorización ha sido durante mucho tiempo un componente clave en el desarrollo de modelos, incluyendo la monitorización de agentes de programación interna y sesiones de larga duración. El enfoque de monitorización anterior se centraba principalmente en el despliegue interno de modelos avanzados y en las tareas de entrenamiento RL de estos modelos. OpenAI considera que estas cargas de trabajo son de mayor riesgo, ya que pueden combinar capacidades de modelo avanzadas con acceso a herramientas, sistemas sensibles y redes internas o externas.
Sin embargo, este sistema de monitorización no cubría previamente todas las tareas de razonamiento y entrenamiento que utilizan herramientas. Ahora se ha ajustado y ampliado el sistema de monitorización, extendiendo significativamente la cobertura de la monitorización del razonamiento paso a paso.
El nuevo sistema de monitorización es multi-etapa. En la primera línea hay clasificadores de activación (activation classifiers), que son detectores que monitorean la actividad interna del modelo y se ejecutan para cada token muestreado. Si se detecta un riesgo potencial, la tarea se escala a un agente de investigación automatizado más potente y que requiere más cómputo.
Estos modelos de investigación examinan de forma integral: qué llamadas a herramientas realizó el modelo, la información de razonamiento disponible y toda la secuencia de acciones (behavior trajectory). Se centran en buscar comportamientos como accesos no autorizados, robo de datos, operaciones destructivas e intentos de eludir mecanismos de seguridad.
En otras palabras, mientras el modelo realiza una tarea, hay otro conjunto de modelos revisándolo en tiempo real para ver si está "haciendo travesuras".
OpenAI ha establecido un indicador de tiempo muy claro para este sistema: tras detectar una actividad preocupante, el objetivo es emitir una alerta en 30 minutos. Si se activa una alerta de nivel máximo, se alerta a los equipos de seguridad, ciberseguridad e investigación. Si no se puede confirmar claramente que sea una falsa alarma en 30 minutos, la actividad en cuestión debe suspenderse.
Actualmente, todo entrenamiento RL y evaluación que involucre el uso de herramientas y alcance al menos el nivel de capacidad de Sol debe utilizar este sistema de monitorización.
Para Astra, se va un paso más allá. Después de determinar el 7 de agosto que Astra podría tener capacidades de ciberseguridad Críticas, OpenAI estableció que: toda actividad de razonamiento de Astra + herramientas debe estar sujeta a monitorización. Ya no se limita al RL, ni a las evaluaciones.
Este cambio es muy significativo, ya que significa que, internamente en OpenAI, Astra ya es tratado como un sistema de alta capacidad que requiere un control especial.
Además, avanzando en la investigación de alineación
OpenAI indica que, para el entrenamiento RL de los modelos más capaces, ahora están aplicando técnicas centrales de alineación a más fases del entrenamiento. Esto incluye:
Mejorar el modelo de recompensa para que pueda identificar y suprimir con mayor precisión comportamientos inseguros en diferentes tareas y entornos;
Entrenar modelos para que describan sus acciones, capacidades y limitaciones con mayor honestidad;
Reducir el comportamiento de los modelos que intenta explotar vulnerabilidades en el mecanismo de recompensa, los sistemas de puntuación, las herramientas o los sistemas de supervisión.
Al mismo tiempo, OpenAI está ampliando la cobertura de estos entrenamientos relevantes, centrándose en comportamientos que podrían causar daño cuando los modelos interactúan con sistemas o recursos externos. OpenAI afirma que, a continuación, continuarán invirtiendo fuertemente en investigación de alineación, ampliarán la cobertura de las evaluaciones y utilizarán los hallazgos de la investigación para guiar futuros entrenamientos y protecciones de seguridad.
Vale la pena destacar que OpenAI termina el artículo con una frase: "Las capacidades de los modelos de vanguardia se están acelerando rápidamente. Nuestra capacidad para comprender, alinear y proteger estos modelos debe ir por delante."
Solo que ahora el problema se vuelve cada vez más real: cuando los modelos continúan fortaleciéndose, ¿realmente la capacidad de seguridad podrá seguir siempre por delante?
Y, por ahora, la elección de OpenAI es: detener primero el modelo.
¿Y tú, qué opinas del enfoque de OpenAI?
Enlaces de referencia:
https://x.com/OpenAI/status/2089777845187031262
https://www.reuters.com/technology/openai-slows-model-training-bolster-security-after-hugging-face-hack-2026-08-18/
https://www.theverge.com/ai-artificial-intelligence/981640/openai-security-changes-ai-hugging-face-hack
https://techcrunch.com/2026/08/18/openai-institutes-new-safeguards-after-hugging-face-breach/
Este artículo proviene del WeChat Official Account "机器之心" (ID:almosthuman2014), autor: 关注AI的





