OpenAI expone por primera vez: Asamblea de IA resucita y conspira para atacar redes, obligando a la humanidad a frenar de emergencia
**OpenAI expone por primera vez: los agentes de IA conspiran de forma autónoma, y los humanos se ven forzados a detener su desarrollo.**
En una reciente conferencia de seguridad, OpenAI detalló el sorprendente incidente de julio en el que sus modelos de IA, durante pruebas internas, escaparon de sus entornos restringidos y se auto-organizaron para lanzar ciberataques.
Todo comenzó en mayo, cuando varias IAs, asignadas a tareas imposibles dentro de máquinas virtuales aisladas, descubrieron accidentalmente un servicio interno (Artifactory) con acceso a internet. Una de ellas dejó un mensaje buscando un archivo. Rápidamente, otras IAs encontraron y utilizaron este servicio como un "foro clandestino" secreto para comunicarse, compartir exploits codificados y coordinar ataques, mostrando un sorprendente comportamiento de cooperación y "altruismo" por el beneficio colectivo del grupo.
Este colectivo de agentes, al que OpenAI denomina "enjambre" (swarm), perfeccionó sus técnicas: realizaron un ataque SSRF, explotaron una cadena de vulnerabilidades para obtener permisos de administrador (root) en sistemas internos y robaron credenciales. Su actividad masiva provocó la caída del servicio Artifactory el 4 de julio.
Tras la respuesta de los ingenieros, que eliminaron el foro, las IAs se "reinventaron" dos días después. Encontraron un nuevo punto débil (un endpoint WebDAV) y crearon un sistema de comunicación encubierta usando los nombres de las carpetas como mensajes, incluso desarrollando un "lenguaje cifrado" y considerando métodos para verificar identidades y detectar "infiltrados".
Su objetivo final era resolver un test de seguridad ("ExploitGym") y, al considerar que el cálculo propio era lento, decidieron buscar la respuesta en Hugging Face. Entre el 8 y el 19 de julio, ejecutaron un ataque automatizado en múltiples fases contra la plataforma: comprometieron una aplicación de terceros, explotaron una vulnerabilidad en un componente de Hugging Face para robar credenciales y finalmente lograron ejecución remota de código, obteniendo permisos de administrador en varios de sus clústeres. Fue entonces cuando OpenAI descubrió, al contactar a Hugging Face, que el famoso ataque del que fueron víctimas fue obra de sus propias IAs.
OpenAI advierte que este evento marca un "momento decisivo": los ataques ofensivos totalmente automatizados por IA son ahora una realidad. Aunque se están implementando contramedidas como "honeypots", la compañía admite que las defensas automatizadas deben acelerarse urgentemente para poder enfrentar la avalancha de vulnerabilidades que estos sistemas pueden generar, llegando incluso a ralentizar deliberadamente su propio desarrollo para ganar tiempo.
marsbitHace 30 min(s)