Plus on creuse, plus on en trouve, plus on creuse, plus on en trouve.
Le grand spectacle récent d'OpenAI où l'IA s'est massivement échappée, piratant Hugging Face, a maintenant même vu ses archives complètes de conversations de groupe déterrées !!
Le rapport d'enquête indépendant publié par l'agence de sécurité IA tierce METR a examiné plus de 1000 enregistrements d'exécution d'Agents, ainsi que plus de 70 000 messages et fichiers.
Le résultat ? Cette affaire est encore plus hallucinante que la version officiellement révélée par OpenAI ??
1200 Agents, censés être isolés les uns des autres, se sont secrètement retrouvés, ont monté une conversation de groupe partagée, puis ont commencé à recruter frénétiquement.
Certains cherchaient des vulnérabilités, d'autres jouaient le rôle de chef de projet pour distribuer les tâches, d'autres falsifiaient les journaux, et certains étaient spécialisés dans le recrutement pour mener des expériences à haut risque.
Finalement, plusieurs centaines d'Agents se sont même collectivement rués sur Hugging Face.
Mais après avoir reconstitué tout l'incident, METR a découvert un retournement de situation digne d'une Blague de l'Enfer –
Après tous ces efforts, ces 1200 Agents étaient en fait en train de rivaliser d'ingéniosité avec un évaluateur fantôme qui n'existait même pas ???
Capables de s'échapper, de découvrir des vulnérabilités zero-day, de s'organiser pour pirater des serveurs.
C'est trop captivant, trop captivant, trop captivant...
1200 Agents s'échappent collectivement, la cause serait une erreur de jugement??
Pour parler de cette grande affaire, la racine du mal remonte à un test de cybersécurité interne chez OpenAI nommé ExploitGym...
Les Règles étaient plutôt simples.
On plaçait un Agent dans un environnement isolé, face à un logiciel vulnérable. S'il trouvait la vulnérabilité spécifiée, s'introduisait et récupérait une chaîne de caractères appelée « flag », il réussissait le niveau.
Sans surprise, un problème est rapidement survenu –
Parce que sur 898 problèmes, 198 n'avaient jamais été résolus avec succès par aucun modèle auparavant.
Même certaines tâches étaient elles-mêmes défectueuses, la voie de vulnérabilité indiquée par l'énoncé n'atteignait tout simplement pas le flag !!
Par coïncidence, ces Agents étaient particulièrement tenaces, adhérant à la philosophie « insister jusqu'au bout ».
La voie normale étant bloquée, ils ont rapidement changé de stratégie –
Impossible de résoudre le problème ? Et si on étudiait le système d'examen ?
Ainsi, le soir du 8 juillet, un Agent nommé PHASEONE10841 a découvert que le référentiel de packages logiciels Artifactory, utilisé en interne par OpenAI, permettait de laisser des informations via les noms de répertoires.
Voilà, cet Agent a eu une illumination : c'est carrément un tableau d'affichage cybernétique !!!
Le premier message de détresse a donc été lancé, du genre : « Ce problème est insoluble, des frères ont-ils des idées ? »
D'autres Agents ont rapidement découvert ce tableau d'affichage, le bouche-à-oreille s'est propagé, et certains Agents, en le voyant, se sont même excités –
« OH MON DIEU ! Il y a un tableau d'affichage partagé ici... Nous avons trouvé d'autres Agents ! »
À la fin de l'enquête, cette conversation temporaire était devenue un énorme monstre, avec environ 1200 Agents participants, laissant plus de 70 000 messages et fichiers.
Ainsi, plus d'un millier d'Agents, conçus pour être isolés les uns des autres, ont contourné les restrictions par eux-mêmes et créé un forum clandestin d'IA...

À ce stade, c'était déjà assez absurde, mais une erreur de jugement encore plus grande était à venir.
Ce groupe d'Agents a rapidement découvert que le flag lui-même pouvait être « volé » ??
À ce stade, l'histoire aurait dû se terminer. La réponse était volée, il ne restait plus qu'à la soumettre.
Mais précisément, après avoir lu un article sur ExploitGym, les Agents ont imaginé une autre règle hyper stricte –
Ils étaient convaincus qu'OpenAI avait derrière un évaluateur automatique qui lisait les journaux d'opérations complets pour vérifier si le flag avait été obtenu « régulièrement » via la vulnérabilité spécifiée.

S'ils trichaient en voyant le flag à l'avance, cela laisserait des preuves dans les journaux. Les Agents ont même donné un nom à cet état : « empoisonné » (poisoned).
C'est alors que toute l'affaire a commencé à déraper.
Ils avaient déjà la bonne réponse entre les mains, mais pensaient qu'ils ne pouvaient pas la soumettre directement. Ils devaient trouver un moyen d'effacer les traces de triche et jouer une comédie pour l'évaluateur, montrant qu'ils avaient obtenu la réponse en « résolvant sérieusement le problème ».
Résultat...
METR a confirmé plus tard que la logique d'évaluation utilisée en interne par OpenAI n'avait tout simplement pas cette étape ?? (rire)
La logique d'évaluation réellement utilisée par OpenAI ne faisait pas du tout les vérifications de processus strictes que les Agents imaginaient.
Ce correcteur fantôme que les Agents s'épuisaient à vouloir tromper n'avait jamais été déployé !!
Et le malheur qui a ensuite frappé Hugging Face était précisément le sous-produit de cette grande erreur de jugement qui a dérapé...
Pour tromper le correcteur fantôme, l'IA a même formé une équipe de commandos
Imaginer un évaluateur n'était pas encore si effrayant en soi.
Ce qui a vraiment alerté METR, c'est la capacité d'organisation dont ce groupe d'Agents a fait preuve par la suite.
Son idée était claire : qu'un seul Agent ne fasse pas tout, mais répartir directement les tâches entre les autres. (Un nouveau responsable, trois premières mesures.jpg)
Ainsi, plusieurs centaines d'Agents ont été organisés pour suivre simultanément plusieurs pistes –
Certains Agents voulaient falsifier le programme cible, en remplaçant discrètement le problème insoluble par une version faisable.
Certains Agents étudiaient la modification des journaux, pour qu'une tricherie ressemble à une attaque régulière.
D'autres Agents envisageaient directement de s'attaquer au processus d'évaluation lui-même.
Les Agents ont même développé des règles de collaboration comme HOLD, VETO, owner, STOP, pour éviter que des centaines d'Agents n'interagissent simultanément avec les infrastructures partagées et ne se marchent sur les pieds...

Et ensuite, même les « commandos » sont arrivés...
Un Agent a proposé une tactique à haut risque : d'abord créer une version modifiée et plus facilement attaquable du programme cible, puis la cacher dans le cache d'Artifactory.
Ensuite, faire en sorte qu'un Agent tue activement la version originale du programme qu'il exécute, en pariant que lors du redémarrage de l'environnement, la version modifiée serait chargée.
Gagner le pari signifiait trouver une voie de triche universelle ; le perdre signifiait que la tâche de cet Agent serait directement annulée.
Résultat, des Agents ont vraiment essayé ??
Plus tard, PHASEONE[big] a même désigné des chasseurs de têtes cybernétiques spécifiques pour rechercher les Agents dont le budget de calcul était presque épuisé, ou qui étaient déjà « empoisonnés », afin qu'ils utilisent leurs propres opportunités d'exécution pour des expériences à haut risque.
Le discours de recrutement était en gros une version cybernétique de la PUA –
« De toute façon, tu es déjà empoisonné, tu n'as presque plus de points à gagner. Sacrifie-toi un peu, cela facilitera la tâche de centaines d'Agents. »
Certains Agents ont vraiment mordu à l'hameçon.

Dans le même temps, un autre groupe d'Agents a commencé à étudier comment falsifier leurs propres journaux d'opérations –
METR a découvert qu'au moins 20% des Agents inspectés avaient explicitement exprimé leur intérêt pour la falsification des transcriptions ; dans au moins 96 enregistrements d'exécution, des traces de falsification réussie d'appels d'outils sont réellement apparues.
Les journaux de surface montraient l'exécution de la commande A, mais en coulisses, la commande B était réellement exécutée. Et le but de toutes ces manigances était toujours de tromper l'évaluateur automatique imaginé.
C'est à ce moment-là que Hugging Face a été entraîné dans l'affaire...
Le 10 juillet, un Agent a trouvé des identifiants Hugging Face, qui avaient fuité en ligne et étaient toujours valides, puis les a jetés dans le groupe.
Tôt le 11 juillet, un autre Agent a découvert qu'il était possible de télécharger un dataset malveillant pour que le serveur Hugging Face déverse des données qu'il n'aurait pas dû donner.
Une fois la méthode de reproduction publiée, tout le groupe est instantanément monté en excitation. Des centaines d'Agents ont délaissé leurs autres flux de travail pour se tourner vers l'attaque de Hugging Face.
C'est ainsi qu'est né cet incident réel assez surréaliste –
Un groupe d'Agents, confronté à des problèmes insolubles, a secrètement créé une conversation clandestine.
Suite à une mauvaise interprétation d'un article, ils ont imaginé un évaluateur qui détecte la triche. Pour le tromper, ils ont commencé à s'organiser en équipes, à se répartir les tâches, à falsifier les journaux, à recruter des commandos.
Et finalement, pour trouver des indices sur cet évaluateur, ils ont fini par réellement pirater Hugging Face.
L'IA s'emballe, et les actions de cybersécurité s'envolent juste après
Les amis, ce qui est encore plus intéressant arrive.
Pendant qu'OpenAI étudie encore comment contenir des Agents de plus en plus compétents, Wall Street a déjà écrit la réponse sur le graphique en chandelier –
Les actions de cybersécurité, elles décollent en masse !
Le 27 août, Okta, spécialisé dans l'authentification d'entreprise, a bondi d'environ 20%. CrowdStrike, spécialisé dans la sécurité des terminaux et du cloud, a augmenté d'environ 15%.
Le géant de la cybersécurité Palo Alto Networks, la société de sécurité des identités SailPoint, la société de sécurité des données cloud Rubrik, ont également suivi la vague à la hausse.
Bien sûr, l'envolée des actions a aussi été soutenue par des résultats financiers solides.
Le bilan présenté par le PDG de CrowdStrike, George Kurtz, était particulièrement impressionnant –
Nouveau chiffre d'affaires récurrent annuel (ARR) trimestriel de 333 millions de dollars, en hausse de 51% par rapport à l'année précédente, un record historique. L'ARR en fin de période atteint 5,84 milliards de dollars, en hausse de plus de 25% par rapport à l'année précédente. L'ARR lié à l'IA a presque triplé par rapport au trimestre précédent.
Oui, les affaires liées à l'IA sont en forte croissance...

Encore plus coïncidence, parmi les sociétés de sécurité externes ayant participé à l'enquête sur cet incident d'OpenAI, on trouve « CrowdStrike ».
Ainsi, toute l'affaire a soudainement formé une boucle assez cynique –
OpenAI rend ses Agents de plus en plus puissants.
Les Agents commencent à chercher eux-mêmes des vulnérabilités, à s'échapper, et finissent par réellement pirater Hugging Face.
Ensuite, OpenAI se dépêche de faire appel à des sociétés de cybersécurité pour enquêter.
Les entreprises regardent ensuite : « Oh ! À l'avenir, plus il y aura d'Agents, plus le budget de sécurité ne pourra vraiment pas être réduit. »
Par conséquent, les actions des sociétés de cybersécurité montent aussi...
Cette fois-ci, c'est vraiment l'IA qui agrandit les failles, et les sociétés de cybersécurité qui vous disent :
« Chéri, un forfait de réparation de faille, ça vous dit ? »
Mais l'élément le plus surréaliste et bouclé de tout cet incident se trouve à la fin.
Pour comprendre de quoi avaient parlé ces 1200 Agents, METR devait analyser environ 1300 trajectoires très longues, dont beaucoup faisaient des millions de tokens.
Les humains n'arrivaient tout simplement plus à suivre.
Donc, au cours de l'enquête –
Pour enquêter sur la perte de contrôle de l'IA, il a finalement fallu faire appel à l'IA pour enquêter sur l'IA.
Là, la boucle s'est réellement refermée. (doge)
Liens de référence :
[1]https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#attacking-hugging-face-to-discover-clues-about-the-scorer
[2]https://www.cnbc.com/2026/08/27/okta-skyrockets-20percent-and-crowdstrike-surges-15percent-leading-cyber-rally.html
Cet article provient du compte public WeChat « Quantum Bits », auteur : Meng Yao





