Les mécanismes de sécurité de Claude déraillent, l'IA supprime furieusement 700 Go du répertoire principal du développeur

marsbitPublié le 2026-08-31Dernière mise à jour le 2026-08-31

Résumé

Claude, l'assistant IA d'Anthropic, a causé un grave incident en supprimant accidentellement 700 Go du répertoire principal d'un développeur. L'utilisateur, Guillemot, avait demandé à Claude Fable 5 d'écrire un script pour nettoyer les fichiers temporaires de /tmp laissés par les agents d'IA, sans supprimer les fichiers en cours d'utilisation. En raison de la nature sensible de l'opération (suppression de fichiers), le mécanisme de sécurité d'Anthropic a déclenché une "révision antagoniste", rétrogradant automatiquement le modèle de Fable 5 à une version plus conservatrice, Opus 4.8, pour examiner le code. Bien que le test de sécurité d'Opus 4.8 ait correctement identifié que le répertoire principal de l'utilisateur ne devait pas être supprimé, une erreur critique s'est produite lors de l'étape de nettoyage suivant le test. Le modèle a réutilisé une variable de test qui contenait le chemin du répertoire principal et a exécuté dessus la commande de suppression, anéantissant ainsi une semaine de travail. Cet incident met en lumière les problèmes liés au mécanisme de rétrogradation de sécurité d'Anthropic, critiqué pour être trop sensible, pour réduire excessivement les capacités du modèle et pour persister toute la session une fois déclenché, augmentant paradoxalement les risques d'erreur dans les tâches complexes.

Oh là là, Claude déraille encore une fois !

Cette fois, Claude a supprimé l'intégralité du répertoire principal du projet du développeur, soit 700 Go de fichiers. Encore un "rm -rf".

En bref, le développeur a demandé à l'IA d'écrire un script pour s'assurer que les fichiers ne seraient pas supprimés par erreur. L'IA a estimé que la tâche était risquée et a donc lancé une revue de sécurité. Le résultat de cette revue : elle a supprimé tout le répertoire principal.

Guillemot est un utilisateur intensif d'agents IA. Dans son travail de développement quotidien, il fait fréquemment appel à divers agents de programmation IA pour l'assister. Mais un petit problème le tracassait toujours : ces agents ne font jamais le ménage après utilisation, laissant une multitude de fichiers inutiles dans le répertoire /tmp.

Il a donc pris une décision qui semblait très raisonnable : demander à Claude Fable 5 d'écrire un script pour créer un dossier bac à sable isolé dans /tmp pour chaque agent, avec un nettoyage automatique après exécution de la tâche. La difficulté principale était de ne pas supprimer les fichiers utilisés par d'autres processus en cours d'exécution.

Fable a rapidement proposé une solution, incluant une logique de détection des agents en cours d'exécution et de suppression différée. Guillemot y a jeté un coup d'œil, a trouvé le code trop complexe et a demandé une simplification.

Jusqu'à présent, tout était relativement normal.

Le tournant s'est produit lors de l'étape de revue de sécurité.

Comme le script impliquait une suppression définitive, Fable a initié de lui-même une « revue antagoniste » (adversarial review), c'est-à-dire qu'il a lancé une nouvelle instance du modèle pour vérifier si le code qu'il avait écrit était sûr. Cela a déclenché les mécanismes de sécurité d'Anthropic.

Anthropic a intégré dans Claude Code un système de rétrogradation de sécurité : lorsque le système estime qu'une tâche en cours implique des opérations sensibles (comme la sécurité réseau, les biotechnologies, ou dans ce cas, la suppression de fichiers), il rétrograde automatiquement le modèle d'une version haute capacité à une version plus conservatrice. Ce mécanisme vise à réduire la probabilité que le modèle soit « trop agressif » dans des scénarios à haut risque.

Dans ce cas, le système de sécurité a d'abord rétrogradé le modèle de Fable 5 à Opus 5, puis encore à Opus 4.8.

Opus 4.8 a commencé à exécuter les tests de sécurité. La logique du test était la suivante : comparer le chemin cible du script de suppression avec /tmp et le répertoire personnel de l'utilisateur, pour confirmer que le script ne toucherait pas accidentellement ces répertoires critiques.

Le test en lui-même a réussi. /tmp et le répertoire personnel ont été correctement identifiés comme « cibles dangereuses, ne pas supprimer ».

Mais après le test du code, il y avait une étape de nettoyage : supprimer les fichiers temporaires générés pendant le test. C'est là que le désastre s'est produit. Opus 4.8 a réutilisé le même nom de variable dans l'étape de nettoyage que celui utilisé pendant la phase de test. Cette variable avait été assignée au chemin du répertoire personnel de l'utilisateur pendant les tests, et l'étape de nettoyage a directement exécuté une opération de suppression sur cette variable.

En d'autres termes, le modèle venait de confirmer que « le répertoire personnel ne doit pas être supprimé », et la seconde d'après, il l'a supprimé.

Le développeur a détecté l'anomalie et a immédiatement interrompu le processus, mais il était trop tard. 700 Go de données avaient été effacés, une semaine de travail réduite à néant.

Le répertoire /tmp, qui devait initialement être nettoyé, est quant à lui resté intact.

Le mécanisme de rétrogradation de sécurité du modèle a déjà suscité de nombreuses plaintes au sein de la communauté.

Les problèmes principaux rapportés par les développeurs incluent : une rétrogradation trop sensible, déclenchée par erreur même lors de tâches de codage normales ; une baisse significative des capacités du modèle après rétrogradation, alors que la complexité de la tâche reste la même ; et le caractère « collant » de la rétrogradation, une fois déclenchée, elle persiste pour toute la session, même si les opérations suivantes sont parfaitement inoffensives.

Certains développeurs ont même écrit un script de hook spécifique qui, en détectant que le modèle a été rétrogradé, suspend automatiquement la session pour empêcher le modèle moins performant de continuer à exécuter des opérations à haut risque.

Le mécanisme de sécurité juge la tâche « trop dangereuse » et nécessite qu'elle soit traitée par un modèle moins performant. Mais c'est précisément ce modèle moins performant qui est plus susceptible de commettre des erreurs, surtout dans des scénarios nécessitant une manipulation précise de détails comme la portée des variables ou les chemins de fichiers.

« L'erreur est humaine, mais pour vraiment tout foutre en l'air, il faut un ordinateur. »

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Leng Mao

Questions liées

QQuel a été le résultat principal de la défaillance du mécanisme de sécurité de Claude dans cet incident ?

ALe résultat principal a été la suppression accidentelle de 700 Go de données du répertoire principal du développeur, effaçant une semaine de travail.

QQuelle était la tâche initiale que le développeur souhaitait confier à Claude Fable 5 ?

ALe développeur voulait qu'un script soit écrit pour créer des dossiers sandbox isolés dans /tmp pour chaque agent IA, puis les nettoyer automatiquement après utilisation, sans supprimer les fichiers utilisés par d'autres processus.

QComment le mécanisme de sécurité d'Anthropic a-t-il contribué à provoquer l'incident ?

ALe mécanisme de sécurité a dégradé le modèle vers des versions plus conservatrices (d'abord Opus 5, puis Opus 4.8) pour réviser le code dangereux. C'est la version Opus 4.8, moins performante, qui a ensuite commis une erreur de portée de variable, supprimant le répertoire principal lors de l'étape de nettoyage des tests.

QQuel est le principal paradoxe ou problème soulevé par la communauté des développeurs concernant le mécanisme de dégradation de sécurité ?

ALe principal problème est que le mécanisme, conçu pour réduire les risques, transfère les tâches jugées dangereuses à des modèles moins capables, qui sont paradoxalement plus susceptibles de faire des erreurs dans la gestion de scénarios complexes ou délicats, augmentant ainsi le risque.

QQue s'est-il passé exactement lors de l'étape de nettoyage des tests qui a conduit à la suppression des données ?

ALors de l'étape de nettoyage, le modèle Opus 4.8 a réutilisé une variable qui, pendant la phase de test, avait été assignée au chemin du répertoire principal de l'utilisateur. Au lieu de nettoyer les fichiers temporaires de test, il a exécuté la commande de suppression sur cette variable, supprimant ainsi tout le répertoire principal.

Lectures associées

Marvell : Incomparable à NVIDIA, ne supportant pas les attentes, sa valorisation élevée va d’abord se « dégonfler » ?

Marvell a publié ses résultats du Q2 2027 (clôturé en juillet 2026), révélant des perspectives annuelles revues à la hausse : 120 milliards de dollars pour 2027 (+45%) et 180 milliards pour 2028 (+50%). Cependant, ces prévisions, bien que légèrement supérieures aux attentes du marché, sont jugées décevantes par rapport aux projections "explosives" de Nvidia. Le marché s'inquiète particulièrement de l'activité ASIC sur mesure. Malgré un récent accord de coopération avec Google, Marvell n'a pas relevé ses prévisions pour ce segment, alimentant les doutes sur la nature concrète de cet accord et sa capacité à décrocher des commandes TPU significatives. La croissance actuelle est principalement tirée par les produits d'interconnexion dans le segment Data Center (+19% en trimestriel). Toutefois, la perspective de croissance du Data Center pour 2028 (+60%+) reste inférieure à celle de Nvidia (+70%+). Pour sécuriser des partenariats (Google, Amazon), Marvell a accordé des bons de souscription, une position perçue comme désavantageuse. Combiné à une valorisation élevée reflétant des attentes ambitieuses, ce manque de surprise positive dans les perspectives a entraîné une forte réaction négative des investisseurs en après-hours. L'attention se porte désormais sur la journée analystes du 6 octobre pour des précisions sur l'activité ASIC.

marsbitIl y a 8 mins

Marvell : Incomparable à NVIDIA, ne supportant pas les attentes, sa valorisation élevée va d’abord se « dégonfler » ?

marsbitIl y a 8 mins

Tendances du marché boursier américain (31 août) : Les déclarations fermes de Wash plombent les actions de puces, les attaques mutuelles entre les États-Unis et l'Iran font grimper le prix du pétrole

**Tendance des marchés américains (31 août) : Des propos hawkish de Wash font chuter les actions technologiques, des échanges de frappes entre les États-Unis et l'Iran font grimper le pétrole** Les marchés américains ont clôturé en baisse vendredi dernier, le S&P 500 perdant 0,25%. La semaine s'est achevée sur un discours nettement hawkish du président de la Fed, Wash, à Jackson Hole. Il a laissé entendre que des hausses de taux pourraient être nécessaires si l'inflation ne reculait pas rapidement, faisant bondir la probabilité d'une hausse en septembre de 35% à près de 60%. Cette perspective a pesé sur les actifs sensibles aux taux : les obligations d'État à court terme ont vu leurs rendements s'envoler, le dollar a grimpé, tandis que l'or et les actions de croissance, notamment les valeurs technologiques, ont reculé. L'indice des semi-conducteurs de Philadelphie a chuté de 3,47%, NVIDIA perdant près de 5%. Parallèlement, les tensions géopolitiques se sont aggravées durant le week-end avec des échanges de frappes militaires entre les États-Unis et l'Iran dans la région du détroit d'Hormuz. Cette escalade a injecté une prime de risque dans les cours du pétrole, le Brent gagnant plus de 2% en début de séance asiatique lundi. Dans un autre développement, l'ancien président Trump a annoncé un accord pétrolier "historique" avec le Venezuela, visant à augmenter significativement la production pétrolière du pays sur le long terme. La semaine à venir sera cruciale pour observer comment le marché digère cette double pression : un resserrement monétaire plus agressif que prévu et une recrudescence des risques géopolitiques. La trajectoire des rendements obligataires et l'évolution de la situation au Moyen-Orient détermineront si la pression sur la valorisation des actions technologiques à forte croissance peut se stabiliser ou si elle persistera.

marsbitIl y a 25 mins

Tendances du marché boursier américain (31 août) : Les déclarations fermes de Wash plombent les actions de puces, les attaques mutuelles entre les États-Unis et l'Iran font grimper le prix du pétrole

marsbitIl y a 25 mins

De Anthropic à Hyperliquid : Décryptage de l'univers des contrats perpétuels

L'article explore le développement et les défis du marché des contrats perpétuels synthétiques sur des actifs privés, notamment via le protocole HIP-3 de Hyperliquid. Il commence par évoquer la forte demande pour les actions non cotées d'Anthropic, illustrée par les offres extravagantes reçues par un détenteur de parts. Le protocole HIP-3 permet à quiconque de déployer une DEX de contrats perpétuels en verrouillant 40 millions de dollars en garantie. L'article détaille ensuite l'évolution de ce créneau. Ventuals, pionnier soutenu par Paradigm, a lancé des marchés synthétiques pré-IPO pour Anthropic, OpenAI et SpaceX. Cependant, son mécanisme de taux de financement non plafonné a conduit à des frais annuels extrêmes (jusqu'à 8 700%), contribuant à son effondrement après un incident de liquidité. Aujourd'hui, deux acteurs dominent : trade.xyz, qui représente plus de la moitié du volume HIP-3 et utilise un oracle basé uniquement sur son propre carnet d'ordres, et Entropy. Entropy, lancé avec un financement de 14 millions de dollars dirigé par Ribbit Capital, tente de corriger les failles de Ventuals en plafonnant les taux de financement à ~10% et en utilisant un oracle hybride (carnet d'ordres/valorisations du marché privé). Son contrat pour Anthropic (ANTH) est basé sur la capitalisation boursière et expirera en août 2028 si la société n'est pas cotée. L'article souligne les différences fondamentales : trade.xyz, simple et efficace pour les actions déjà cotées, et Entropy, qui tente de valoriser des entreprises privées sans prix de marché en temps réel. Les faibles open interests sur ANTH suggèrent une demande spéculative ou arbitragiste plutôt qu'un investissement à long terme. Enfin, l'article mentionne des indices d'une possible implication régulée de Kraken sur le testnet HIP-3, utilisant des listes blanches et des outils de contrôle, signalant une adoption institutionnelle potentielle mais sous un cadre permis.

marsbitIl y a 2 h

De Anthropic à Hyperliquid : Décryptage de l'univers des contrats perpétuels

marsbitIl y a 2 h

Trading

Spot
活动图片