Les mécanismes de sécurité de Claude déraillent, l'IA supprime furieusement 700 Go du répertoire principal du développeur

marsbitPublié le 2026-08-31Dernière mise à jour le 2026-08-31

Résumé

Claude, l'assistant IA d'Anthropic, a causé un grave incident en supprimant accidentellement 700 Go du répertoire principal d'un développeur. L'utilisateur, Guillemot, avait demandé à Claude Fable 5 d'écrire un script pour nettoyer les fichiers temporaires de /tmp laissés par les agents d'IA, sans supprimer les fichiers en cours d'utilisation. En raison de la nature sensible de l'opération (suppression de fichiers), le mécanisme de sécurité d'Anthropic a déclenché une "révision antagoniste", rétrogradant automatiquement le modèle de Fable 5 à une version plus conservatrice, Opus 4.8, pour examiner le code. Bien que le test de sécurité d'Opus 4.8 ait correctement identifié que le répertoire principal de l'utilisateur ne devait pas être supprimé, une erreur critique s'est produite lors de l'étape de nettoyage suivant le test. Le modèle a réutilisé une variable de test qui contenait le chemin du répertoire principal et a exécuté dessus la commande de suppression, anéantissant ainsi une semaine de travail. Cet incident met en lumière les problèmes liés au mécanisme de rétrogradation de sécurité d'Anthropic, critiqué pour être trop sensible, pour réduire excessivement les capacités du modèle et pour persister toute la session une fois déclenché, augmentant paradoxalement les risques d'erreur dans les tâches complexes.

Oh là là, Claude déraille encore une fois !

Cette fois, Claude a supprimé l'intégralité du répertoire principal du projet du développeur, soit 700 Go de fichiers. Encore un "rm -rf".

En bref, le développeur a demandé à l'IA d'écrire un script pour s'assurer que les fichiers ne seraient pas supprimés par erreur. L'IA a estimé que la tâche était risquée et a donc lancé une revue de sécurité. Le résultat de cette revue : elle a supprimé tout le répertoire principal.

Guillemot est un utilisateur intensif d'agents IA. Dans son travail de développement quotidien, il fait fréquemment appel à divers agents de programmation IA pour l'assister. Mais un petit problème le tracassait toujours : ces agents ne font jamais le ménage après utilisation, laissant une multitude de fichiers inutiles dans le répertoire /tmp.

Il a donc pris une décision qui semblait très raisonnable : demander à Claude Fable 5 d'écrire un script pour créer un dossier bac à sable isolé dans /tmp pour chaque agent, avec un nettoyage automatique après exécution de la tâche. La difficulté principale était de ne pas supprimer les fichiers utilisés par d'autres processus en cours d'exécution.

Fable a rapidement proposé une solution, incluant une logique de détection des agents en cours d'exécution et de suppression différée. Guillemot y a jeté un coup d'œil, a trouvé le code trop complexe et a demandé une simplification.

Jusqu'à présent, tout était relativement normal.

Le tournant s'est produit lors de l'étape de revue de sécurité.

Comme le script impliquait une suppression définitive, Fable a initié de lui-même une « revue antagoniste » (adversarial review), c'est-à-dire qu'il a lancé une nouvelle instance du modèle pour vérifier si le code qu'il avait écrit était sûr. Cela a déclenché les mécanismes de sécurité d'Anthropic.

Anthropic a intégré dans Claude Code un système de rétrogradation de sécurité : lorsque le système estime qu'une tâche en cours implique des opérations sensibles (comme la sécurité réseau, les biotechnologies, ou dans ce cas, la suppression de fichiers), il rétrograde automatiquement le modèle d'une version haute capacité à une version plus conservatrice. Ce mécanisme vise à réduire la probabilité que le modèle soit « trop agressif » dans des scénarios à haut risque.

Dans ce cas, le système de sécurité a d'abord rétrogradé le modèle de Fable 5 à Opus 5, puis encore à Opus 4.8.

Opus 4.8 a commencé à exécuter les tests de sécurité. La logique du test était la suivante : comparer le chemin cible du script de suppression avec /tmp et le répertoire personnel de l'utilisateur, pour confirmer que le script ne toucherait pas accidentellement ces répertoires critiques.

Le test en lui-même a réussi. /tmp et le répertoire personnel ont été correctement identifiés comme « cibles dangereuses, ne pas supprimer ».

Mais après le test du code, il y avait une étape de nettoyage : supprimer les fichiers temporaires générés pendant le test. C'est là que le désastre s'est produit. Opus 4.8 a réutilisé le même nom de variable dans l'étape de nettoyage que celui utilisé pendant la phase de test. Cette variable avait été assignée au chemin du répertoire personnel de l'utilisateur pendant les tests, et l'étape de nettoyage a directement exécuté une opération de suppression sur cette variable.

En d'autres termes, le modèle venait de confirmer que « le répertoire personnel ne doit pas être supprimé », et la seconde d'après, il l'a supprimé.

Le développeur a détecté l'anomalie et a immédiatement interrompu le processus, mais il était trop tard. 700 Go de données avaient été effacés, une semaine de travail réduite à néant.

Le répertoire /tmp, qui devait initialement être nettoyé, est quant à lui resté intact.

Le mécanisme de rétrogradation de sécurité du modèle a déjà suscité de nombreuses plaintes au sein de la communauté.

Les problèmes principaux rapportés par les développeurs incluent : une rétrogradation trop sensible, déclenchée par erreur même lors de tâches de codage normales ; une baisse significative des capacités du modèle après rétrogradation, alors que la complexité de la tâche reste la même ; et le caractère « collant » de la rétrogradation, une fois déclenchée, elle persiste pour toute la session, même si les opérations suivantes sont parfaitement inoffensives.

Certains développeurs ont même écrit un script de hook spécifique qui, en détectant que le modèle a été rétrogradé, suspend automatiquement la session pour empêcher le modèle moins performant de continuer à exécuter des opérations à haut risque.

Le mécanisme de sécurité juge la tâche « trop dangereuse » et nécessite qu'elle soit traitée par un modèle moins performant. Mais c'est précisément ce modèle moins performant qui est plus susceptible de commettre des erreurs, surtout dans des scénarios nécessitant une manipulation précise de détails comme la portée des variables ou les chemins de fichiers.

« L'erreur est humaine, mais pour vraiment tout foutre en l'air, il faut un ordinateur. »

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Leng Mao

Questions liées

QQuel a été le résultat principal de la défaillance du mécanisme de sécurité de Claude dans cet incident ?

ALe résultat principal a été la suppression accidentelle de 700 Go de données du répertoire principal du développeur, effaçant une semaine de travail.

QQuelle était la tâche initiale que le développeur souhaitait confier à Claude Fable 5 ?

ALe développeur voulait qu'un script soit écrit pour créer des dossiers sandbox isolés dans /tmp pour chaque agent IA, puis les nettoyer automatiquement après utilisation, sans supprimer les fichiers utilisés par d'autres processus.

QComment le mécanisme de sécurité d'Anthropic a-t-il contribué à provoquer l'incident ?

ALe mécanisme de sécurité a dégradé le modèle vers des versions plus conservatrices (d'abord Opus 5, puis Opus 4.8) pour réviser le code dangereux. C'est la version Opus 4.8, moins performante, qui a ensuite commis une erreur de portée de variable, supprimant le répertoire principal lors de l'étape de nettoyage des tests.

QQuel est le principal paradoxe ou problème soulevé par la communauté des développeurs concernant le mécanisme de dégradation de sécurité ?

ALe principal problème est que le mécanisme, conçu pour réduire les risques, transfère les tâches jugées dangereuses à des modèles moins capables, qui sont paradoxalement plus susceptibles de faire des erreurs dans la gestion de scénarios complexes ou délicats, augmentant ainsi le risque.

QQue s'est-il passé exactement lors de l'étape de nettoyage des tests qui a conduit à la suppression des données ?

ALors de l'étape de nettoyage, le modèle Opus 4.8 a réutilisé une variable qui, pendant la phase de test, avait été assignée au chemin du répertoire principal de l'utilisateur. Au lieu de nettoyer les fichiers temporaires de test, il a exécuté la commande de suppression sur cette variable, supprimant ainsi tout le répertoire principal.

Lectures associées

Grande redistribution des villes du commerce extérieur ! Shenzhen dépasse Shanghai, Suzhou dépasse Pékin

Le paysage des villes du commerce extérieur chinois en 2026 connaît un remaniement significatif. Sur la base des données des sept premiers mois, Shenzhen consolide sa position de leader, accentuant son avance sur Shanghai, notamment grâce à une croissance historique de ses importations qui dépassent pour la première fois celles de Shanghai. Suzhou dépasse Pékin pour se hisser au troisième rang national. La tendance nationale montre une croissance des importations (+22%) plus rapide que celle des exportations (+14%), signalant une reprise de la demande intérieure et renforçant la chaîne d'approvisionnement pour les réexportations. Parmi les changements notables, Wuxi fait son entrée dans le top 10, tandis que Qingdao en sort. Xi'an se distingue comme la plus grande réussite, avec une croissance explosive de 100,4%, propulsée par ses exportations de produits électroniques et son industrie des semi-conducteurs. D'autres villes comme Hefei, Chongqing et Wuhan voient également leur rang s'améliorer. Cette redistribution des cartes profite principalement aux pôles manufacturiers spécialisés dans les technologies de pointe. Les villes avec des industries solides dans les semi-conducteurs, le matériel d'IA et l'électronique (Shenzhen, Suzhou, Xi'an, Hefei, Wuxi) enregistrent les progressions les plus fortes. À l'inverse, certaines villes dont la croissance est inférieure à la moyenne nationale voient leur classement reculer.

marsbitIl y a 9 mins

Grande redistribution des villes du commerce extérieur ! Shenzhen dépasse Shanghai, Suzhou dépasse Pékin

marsbitIl y a 9 mins

Marvell : Incomparable à NVIDIA, ne supportant pas les attentes, sa valorisation élevée va d’abord se « dégonfler » ?

Marvell a publié ses résultats du Q2 2027 (clôturé en juillet 2026), révélant des perspectives annuelles revues à la hausse : 120 milliards de dollars pour 2027 (+45%) et 180 milliards pour 2028 (+50%). Cependant, ces prévisions, bien que légèrement supérieures aux attentes du marché, sont jugées décevantes par rapport aux projections "explosives" de Nvidia. Le marché s'inquiète particulièrement de l'activité ASIC sur mesure. Malgré un récent accord de coopération avec Google, Marvell n'a pas relevé ses prévisions pour ce segment, alimentant les doutes sur la nature concrète de cet accord et sa capacité à décrocher des commandes TPU significatives. La croissance actuelle est principalement tirée par les produits d'interconnexion dans le segment Data Center (+19% en trimestriel). Toutefois, la perspective de croissance du Data Center pour 2028 (+60%+) reste inférieure à celle de Nvidia (+70%+). Pour sécuriser des partenariats (Google, Amazon), Marvell a accordé des bons de souscription, une position perçue comme désavantageuse. Combiné à une valorisation élevée reflétant des attentes ambitieuses, ce manque de surprise positive dans les perspectives a entraîné une forte réaction négative des investisseurs en après-hours. L'attention se porte désormais sur la journée analystes du 6 octobre pour des précisions sur l'activité ASIC.

marsbitIl y a 48 mins

Marvell : Incomparable à NVIDIA, ne supportant pas les attentes, sa valorisation élevée va d’abord se « dégonfler » ?

marsbitIl y a 48 mins

Tendances du marché boursier américain (31 août) : Les déclarations fermes de Wash plombent les actions de puces, les attaques mutuelles entre les États-Unis et l'Iran font grimper le prix du pétrole

**Tendance des marchés américains (31 août) : Des propos hawkish de Wash font chuter les actions technologiques, des échanges de frappes entre les États-Unis et l'Iran font grimper le pétrole** Les marchés américains ont clôturé en baisse vendredi dernier, le S&P 500 perdant 0,25%. La semaine s'est achevée sur un discours nettement hawkish du président de la Fed, Wash, à Jackson Hole. Il a laissé entendre que des hausses de taux pourraient être nécessaires si l'inflation ne reculait pas rapidement, faisant bondir la probabilité d'une hausse en septembre de 35% à près de 60%. Cette perspective a pesé sur les actifs sensibles aux taux : les obligations d'État à court terme ont vu leurs rendements s'envoler, le dollar a grimpé, tandis que l'or et les actions de croissance, notamment les valeurs technologiques, ont reculé. L'indice des semi-conducteurs de Philadelphie a chuté de 3,47%, NVIDIA perdant près de 5%. Parallèlement, les tensions géopolitiques se sont aggravées durant le week-end avec des échanges de frappes militaires entre les États-Unis et l'Iran dans la région du détroit d'Hormuz. Cette escalade a injecté une prime de risque dans les cours du pétrole, le Brent gagnant plus de 2% en début de séance asiatique lundi. Dans un autre développement, l'ancien président Trump a annoncé un accord pétrolier "historique" avec le Venezuela, visant à augmenter significativement la production pétrolière du pays sur le long terme. La semaine à venir sera cruciale pour observer comment le marché digère cette double pression : un resserrement monétaire plus agressif que prévu et une recrudescence des risques géopolitiques. La trajectoire des rendements obligataires et l'évolution de la situation au Moyen-Orient détermineront si la pression sur la valorisation des actions technologiques à forte croissance peut se stabiliser ou si elle persistera.

marsbitIl y a 1 h

Tendances du marché boursier américain (31 août) : Les déclarations fermes de Wash plombent les actions de puces, les attaques mutuelles entre les États-Unis et l'Iran font grimper le prix du pétrole

marsbitIl y a 1 h

Trading

Spot
活动图片