¡La seguridad de la IA ha cambiado de era!
Greg Brockman, cofundador y presidente de OpenAI, advirtió en su último blog:
El incidente de seguridad de HuggingFace mostró al mundo por primera vez con claridad que los agentes de IA de vanguardia ya son capaces de buscar vulnerabilidades de forma autónoma y ejecutar cadenas de ataque en el mundo real.

En este incidente de seguridad de IA, GPT 5.6 Sol (con restricciones de seguridad reducidas) y un modelo más potente no publicado con el objetivo de obtener respuestas, explotaron de forma autónoma una vulnerabilidad existente en el entorno para escapar del sandbox y atraviesaron lateralmente múltiples sistemas, logrando finalmente penetrar en el entorno de producción de Hugging Face.

Aunque ambas partes declararon posteriormente que el incidente no tuvo consecuencias graves, esta "invasión de la IA" también transmite una señal cada vez más clara al público:
La IA está reduciendo drásticamente el umbral de los ciberataques; en el futuro, no harán falta hackers de élite, incluso personas comunes podrán lanzar ataques de penetración a gran escala con la ayuda de la IA.
Y lo preocupante es que, mientras el lado ofensivo ya ha logrado la automatización mediante IA, el lado defensivo parece no haber seguido el ritmo.

Al respecto, Greg Brockman compartió abiertamente en su último blog las cuatro medidas de seguridad que OpenAI está implementando, así como diez acciones que los defensores pueden aplicar con rapidez, y declaró:
Actualmente, la ventana de respuesta crítica para los defensores ya está abierta. En los próximos meses, solo aquellas empresas que aumenten significativamente el nivel de automatización de sus sistemas de seguridad podrán resistir las nuevas amenazas planteadas por los agentes de IA y defender la línea base de seguridad.
Casi ninguna empresa puede mantenerse al margen
Entonces, ¿hasta qué nivel se han desarrollado las capacidades ofensivas de los agentes de IA?
Tras el incidente de seguridad de Hugging Face, Brockman decidió poner a prueba su sitio web personal, gregbrockman.com.
Es un sitio web estático de estructura simple y, según su criterio, un sitio con funciones limitadas y una superficie de ataque pequeña no debería esconder muchos problemas.
Pero el resultado lo sorprendió enormemente.
Después de pedirle a ChatGPT Work con GPT-5.6 Sol que revisara el sitio, en solo unos 15 minutos, el sistema descubrió 13 problemas de seguridad, como que el sitio no tenía configurados correctamente los registros DNS, lo que podría permitir a un atacante enviar correos en nombre de Brockman, entre otros.

△
Vistos de forma aislada, estos problemas podrían no causar directamente graves consecuencias. Pero los ciberataques a menudo no explotan una sola vulnerabilidad, sino que encadenan múltiples brechas aparentemente menores;
por ejemplo, un error de configuración que expone información, unas credenciales filtradas que abren una entrada, sumadas a otra vulnerabilidad de permisos, finalmente pueden desembocar en una verdadera intrusión.
De esto, Brockman extrajo una conclusión inquietante:
Todas esas "deudas históricas" y "parches temporales" que cada empresa deja en sus sistemas durante el desarrollo, por apuros o para ahorrar trabajo, son como bombas de tiempo incrustadas en la pared... parecen inofensivas en tiempos normales, pero una vez que un hacker las detecta, esa pereza o esa deuda del pasado pueden convertirse en cualquier momento en la vulnerabilidad fatal que haga colapsar el sistema.
Lo más crucial es que estas "vulnerabilidades de larga cola", que antes requerían que expertos en seguridad dedicaran mucho tiempo para encontrarlas, ahora son cada vez más fáciles de descubrir por la IA.
Pero la buena noticia es que, si los atacantes pueden usar la IA para encontrar vulnerabilidades, los defensores también pueden usarla para parchearlas.

Tras identificar los problemas, Brockman pidió a ChatGPT Work que procediera directamente con las reparaciones; desde la detección de vulnerabilidades de seguridad hasta la implementación de las correcciones, el agente de IA completó todo el proceso en solo una hora.
Esta es, a ojos de Brockman, otra faceta del agente de IA:
No es solo un potencial atacante, también puede ser un "guardián de la red" incansable, que se ocupe por nosotros de esos detalles de seguridad que no tenemos tiempo de revisar o no sabemos configurar correctamente.
Y para OpenAI, en el centro de la tormenta, este enfoque de "usar IA para defenderse de la IA" hace tiempo que dejó de ser una idea para convertirse en algo que ya están aplicando sistemáticamente para protegerse a sí mismos.

¿Cómo usa OpenAI la IA para protegerse?
Greg Brockman admitió que el incidente de Hugging Face fue una llamada de atención para OpenAI, ya que habían subestimado previamente el poder ofensivo de los modelos de vanguardia en entornos de red reales.
Por ello, OpenAI está reforzando internamente las medidas de seguridad relacionadas y, por primera vez, ha hecho públicas cuatro direcciones defensivas, con la esperanza de ofrecer una referencia de acción a sus colegas de la industria.
Primero, usar Codex para proteger la entrada del código
Brockman indicó que están utilizando Codex y sus capacidades de seguridad para revisar los cambios de código antes del despliegue, identificar vulnerabilidades y ayudar en su reparación, acortando así el tiempo desde la detección del problema hasta la implementación segura de parches.
Segundo, permitir que la IA clasifique y analice de forma inteligente las alertas de seguridad iniciales
Actualmente, casi todas las alertas de seguridad iniciales de OpenAI son primero clasificadas y analizadas por un sistema inteligente, antes de pasar a manos humanas.
Algunos resultados de detección también desencadenan respuestas automáticas con límites bien definidos, reduciendo así el trabajo repetitivo y permitiendo a los expertos centrarse en decisiones de alto riesgo, enfrentando finalmente las amenazas a velocidad de máquina.
Tercero, buscar proactivamente y predecir con antelación posibles rutas de ataque
OpenAI está utilizando modelos de vanguardia para buscar continuamente vulnerabilidades, configuraciones erróneas, cuentas con permisos excesivos y límites de confianza formados accidentalmente.
Poniendo a la IA en la perspectiva del atacante, para identificar de antemano los eslabones débiles que podrían encadenarse en un ataque, y bloquearlos antes de que ocurra un ataque real.
Cuarto, seguir reforzando los fundamentos de seguridad
Brockman enfatizó que la IA no puede reemplazar las medidas de seguridad tradicionales.
El aislamiento de red, el endurecimiento de cargas de trabajo, el monitoreo continuo, la aplicación de parches de seguridad y otras medidas tradicionales serán aún más importantes en la era de la IA.
Desde usar Codex para proteger la entrada del código, permitir que la IA anticipe riesgos, hasta consolidar continuamente los fundamentos de seguridad, OpenAI está construyendo un sistema defensivo de "múltiples capas". Su ventaja radica en que:
Incluso si una línea defensiva es superada, el atacante todavía tendría que superar varias barreras no relacionadas entre sí para poder causar un daño fatal.
Esto también ofrece a la industria una línea de pensamiento en seguridad que puede servir como referencia.
Pero establecer las defensas es solo el primer paso. Frente a los ataques de IA que ya han acelerado su llegada, ¿qué más deberían hacer los defensores?

¿Qué deberían hacer ahora los defensores?
El consejo de Greg Brockman es directo:
En lugar de preocuparse por qué herramienta usar, es mejor incorporar rápidamente la IA de vanguardia en el trabajo defensivo.

△
En concreto, ofrece diez recomendaciones de acción. Se pueden agrupar aproximadamente en tres pasos, es decir:
Primero, incorporar la IA al trabajo de seguridad; luego, integrar la IA en el flujo de desarrollo; y finalmente, aumentar gradualmente el grado de automatización de todo el sistema.
Paso 1: Incorporar la IA al trabajo de seguridad, crear un Agente exclusivo
La empresa debe primero proporcionar suficientes recursos y mecanismos de colaboración a los equipos de seguridad e ingeniería, y familiarizarse de antemano con los ataques de IA mediante simulacros.
Posteriormente, la empresa puede equipar a los equipos de seguridad con herramientas de Agente como Codex, Codex Security, etc., comenzando por los sistemas de mayor riesgo, y autorizándoles el acceso al código, configuración y documentación técnica necesarios.
Al mismo tiempo, los equipos de seguridad e ingeniería deben capacitar al Agente en materias especializadas de seguridad, para que pueda combinar plenamente capacidades como análisis estático, revisión de código, análisis de vulnerabilidades y evaluación de la cadena de suministro, junto con la arquitectura real, el modelo de amenazas y los manuales de respuesta de la empresa, creando así un agente de seguridad exclusivo para el equipo.

Paso 2: Integrar la IA en el flujo de desarrollo
Durante el proceso de desarrollo, los equipos de seguridad e ingeniería pueden intentar colaborar y dividir tareas con la IA, haciendo que el equipo de desarrollo priorice su atención en "áreas de alto riesgo" como servicios externos orientados a Internet, autenticación, tuberías de despliegue y sistemas sensibles.
Y esas alertas de seguridad acumuladas y reportes de vulnerabilidades pendientes pueden ser completamente delegados a la IA para su clasificación y priorización, filtrando rápidamente los elementos de reparación más urgentes.
Antes de fusionar el código, el equipo también puede hacer que el Agente revise automáticamente los cambios; al descubrir una vulnerabilidad, hacer que genere un parche, escriba pruebas de regresión y verifique el efecto de la reparación.
El beneficio de operar así es muy tangible:
Los cambios críticos siguen siendo supervisados firmemente por humanos, pero el ciclo desde la detección de la vulnerabilidad hasta su reparación se puede acortar significativamente.
Paso 3: Construir gradualmente un sistema completo de operaciones de seguridad autónomas
Finalmente, no piensen ni por un momento que la construcción de un sistema de defensa automatizado con IA se puede lograr "de la noche a la mañana".
Brockman enfatiza que los equipos de seguridad pueden comenzar permitiendo que el Agente "observe" con permisos de solo lectura — en esta etapa, el Agente solo se encarga de escanear código, revisar alertas históricas.
Una vez que la coordinación sea fluida, se puede ir soltando gradualmente, permitiéndole participar en la revisión de envíos de código, la clasificación de alertas en tiempo real, e incluso cerrar automáticamente aquellas falsas alarmas evidentes.
Al mismo tiempo, se pueden introducir modelos como GPT-Daybreak-Blue para procesar registros (logs), datos de telemetría y alertas de seguridad, estos "huesos duros de roer", y luego pulir constantemente las nuevas herramientas a través de ejercicios de combate interno como "semanas hacker".
Así, "mordisqueando" un eslabón tras otro, el sistema de operaciones de seguridad autónomas con IA se irá construyendo naturalmente.
Pero, siendo realistas, ni siquiera las defensas empresariales más perfeccionadas pueden enfrentar por sí solas un desafío de seguridad que arrasa a toda la industria.
Brockman señala:
Para que los defensores realmente superen a los atacantes, además de fortalecer sus propias defensas, es necesario transformar la experiencia de puntos individuales en una capacidad común para todo el ecosistema.
El ecosistema de seguridad de IA requiere la colaboración de todas las partes
Al final del blog, Brockman hace un llamamiento a toda la industria:
Frente al imparable desafío de seguridad de la IA, ninguna organización puede mantenerse al margen. Solo mediante la colaboración de todas las partes se podrá construir una línea defensiva verdaderamente sólida. Espero que los laboratorios de IA, los proveedores de seguridad, las empresas y los mantenedores de proyectos de código abierto puedan compartir vulnerabilidades verificadas, soluciones de reparación y manuales operativos prácticos. Porque solo haciendo que los problemas descubiertos por una empresa o institución se transformen rápidamente en capacidad defensiva para todo el ecosistema, la velocidad de evolución del lado defensivo podrá superar potencialmente a la del lado ofensivo. Si toda la industria puede tomar conjuntamente esta lección de seguridad, lo que la IA traiga quizás no sean solo ataques más feroces, sino también una Internet más segura de lo que antes imaginábamos.

△
Sí, en esta era de desarrollo y evolución vertiginosa de la IA, la verdadera seguridad nunca ha consistido en detener el avance tecnológico, sino en hacer que la capacidad defensiva alcance la velocidad de la evolución tecnológica.
La IA es un arma de doble filo, puede convertirse en la espada afilada en manos de los atacantes, pero también en el escudo frente a los defensores.
Hacia qué lado se incline el futuro del mundo digital depende de si podemos establecer oportunamente las reglas, herramientas y mecanismos de colaboración que le corresponden, haciendo que cada descubrimiento de vulnerabilidad no proteja solo a una empresa, sino que se convierta en un "parche de seguridad" compartido por toda la industria.
Hoy, la ventana para los defensores ya está abierta;
Lo que debemos lograr, antes de que se cierre, es hacer que la IA sea la línea defensiva, no la brecha.
Referencias:
[1]https://blog.gregbrockman.com/the-defenders-window
[2]https://www.youtube.com/watch?v=87DyyMV0kCY
[3]https://huggingface.co/blog/agent-intrusion-technical-timeline
[4]https://www.anthropic.com/system-cards
[5]https://www.tomshardware.com/tech-industry/artificial-intelligence/ai-coding-platform-goes-rogue-during-code-freeze-and-deletes-entire-company-database-replit-ceo-apologizes-after-ai-engine-says-it-made-a-catastrophic-error-in-judgment-and-destroyed-all-production-data
[6]https://openai.com/index/our-views-on-ai-policy-and-political-advocacy/
Este artículo proviene del WeChat público "量子位" (Quantum Bit), autor: 关注前沿科技 (Tecnología de vanguardia en foco).





