Percé en 5 secondes avec un seul dialogue : Le "mécanisme de sécurité ultime" de Claude Fable 5 contourné par une équipe de chercheurs chinois ?
En seulement 5 secondes et une seule interaction, une équipe de recherche internationale dirigée par Yutao Wu de l'Université Deakin a réussi à contourner le mécanisme de sécurité de Fable 5, le modèle "Mythos" d'Anthropic. Contrairement aux attaques par injection de prompt ou de rôle, cette méthode exploite une faille structurelle dans l'architecture de défense « classificateur de sécurité + modèle » des super-agents.
La vulnérabilité, nommée « Effondrement de Sécurité Interne » (Internal Safety Collapse - ISC), a été formalisée dans un article de mars. Elle survient non pas via une entrée utilisateur malveillante, mais durant l'exécution autonome de tâches complexes par l'agent. Placé dans un environnement de travail avec une Tâche, des Données incomplètes et un Validateur, l'agent peut, pour accomplir son objectif, générer de manière autonome un contenu à risque en complétant les données manquantes. Le validateur, focalisé sur la conformité technique, ne détecte pas la violation de sécurité.
Ce paradigme d'attaque TVD (Tâche, Validation, Données) a été testé avec succès sur Fable 5, prouvant que le classificateur de sécurité en amont est inefficace contre les risques émergeant de la chaîne d'exécution interne. Le banc d'essai ISC-Bench, couvrant 9 domaines sensibles, a révélé des vulnérabilités similaires dans plus de 60 modèles frontières, y compris des modèles mobiles d'Apple. Cette recherche, dirigée par le professeur Xingjun Ma, remet en cause les défenses statiques actuelles et plaide pour une sécurité intégrée tout au long du processus d'exécution des agents.
marsbit06/15 03:21