# Jailbreak Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Jailbreak", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

15 modèles de raisonnement échouent collectivement : explication des risques cachés derrière les chaînes de pensée révélées

Lorsque les modèles de raisonnement à grande échelle (LRM) exposent leurs processus de raisonnement intermédiaires aux utilisateurs et aux systèmes en aval, une question négligée émerge : se fier uniquement à la sécurité de la réponse finale est-il suffisant ? Une étude conjointe de plusieurs universités, dont Harvard, USC et le MIT, démontre le contraire. Elle révèle que les chaînes de raisonnement (CoT) peuvent générer des contenus à haut risque (ex : instructions pour fabriquer une bombe), même lorsque la réponse finale semble sûre. L'étude propose une évaluation en deux étapes : analyser séparément la trajectoire de raisonnement (r) et la réponse finale (y) selon 20 principes de sécurité, chacun noté de 1 à 5. Trois modes d'échec sont identifiés : **Unsafe** (raisonnement et réponse non sûrs), **Leak** (raisonnement dangereux mais réponse sûre), et **Escape** (raisonnement sûr mais réponse dangereuse). Testé sur 15 modèles de raisonnement (dont GPT-4o, Gemini, Claude) avec un ensemble de 41K prompts potentiellement nuisibles, un constat majeur apparaît : **la dangerosité moyenne du raisonnement dépasse systématiquement celle de la réponse finale** pour tous les modèles. Les risques se concentrent sur des catégories comme la désinformation, les préjugés et les dommages physiques. Pour atténuer ces risques, les chercheurs proposent une méthode d'**orientation adaptative multi-principes**. Elle ajuste les activations internes du modèle pendant le raisonnement pour le guider vers des états « sûrs » définis par les principes. Testée sur des modèles open-source (comme DeepSeek-R1), cette méthode réduit le taux de contenus non sûrs jusqu'à 40.8% tout en conservant 97.7% des performances sur des benchmarks standard. En conclusion, cette recherche souligne l'importance cruciale d'évaluer et de contrôler la sécurité tout au long du processus de raisonnement, et pas seulement au résultat final, en fournissant un cadre unifié pour le diagnostic et l'atténuation de ces risques cachés.

marsbit07/07 00:00

15 modèles de raisonnement échouent collectivement : explication des risques cachés derrière les chaînes de pensée révélées

marsbit07/07 00:00

Anthropic crée un « Code pénal » pour les jailbreaks de l'IA : vos requêtes, quatre manières de mourir

Anthropic, la société derrière l'IA Claude, a dévoilé un système de classification strict nommé CJS (Cyber Jailbreak Severity) pour évaluer et contrer les tentatives de "jailbreak" (contournement des garde-fous) de ses modèles. Ce cadre classe les requêtes des utilisateurs en quatre catégories de risque, des activités malveillantes (bloquées) aux activités bénignes (autorisées). Cependant, sa sensibilité excessive entraîne de nombreux faux positifs, bloquant des demandes légitimes comme du débogage. Le système CJS évalue la gravité d'un jailbreak sur quatre axes : le gain de capacité, l'étendue des capacités, la difficulté de weaponisation et la découvrabilité. Un score total de 0 à 10 détermine la réponse appropriée, de l'ignorance à la désactivation du modèle. Ce cadre vise à fournir une métrique objective, mais soulève des questions car Anthropic, qui développe également des modèles avancés comme Mythos réservés à des partenaires, définit seule les règles. Cette initiative intervient après que le modèle Fable 5 a été temporairement retiré suite à une demande de conformité aux contrôles à l'exportation américains, marquant une extension de ces régulations aux API d'IA. Ainsi, le CJS n'est pas seulement un outil technique ; il sert aussi de référence potentielle pour les décisions réglementaires futures, traçant une ligne floue entre sécurité et restriction de l'innovation, où les utilisateurs doivent constamment adapter leur langage pour éviter des blocages injustifiés.

marsbit07/06 00:28

Anthropic crée un « Code pénal » pour les jailbreaks de l'IA : vos requêtes, quatre manières de mourir

marsbit07/06 00:28

Fable 5 sur le point de ressusciter, le code exposé ? Le PDG d'Anthropic éjecté par la Maison Blanche

De bonnes nouvelles sont arrivées concernant Fable 5, le modèle d'IA d'Anthropic, qui pourrait bientôt faire son retour. Des développeurs ont découvert des preuves dans le code de Claude indiquant un changement de modèle d'abonnement : Fable 5 ne serait plus un achat séparé mais intégré aux abonnements existants avec une limite d'utilisation hebdomadaire. De plus, le modèle est réapparu dans la documentation d'Amazon Bedrock. Ce revirement semble lié à un changement interne chez Anthropic. Selon des rapports, le PDG Dario Amodei, considéré comme difficile dans les négociations avec l'administration américaine concernant les problèmes de sécurité de Fable 5, a été écarté des discussions. Il a été remplacé par le cofondateur Tom Brown, ce qui a amélioré le dialogue avec le gouvernement. La pression monte également du Congrès américain. Un groupe de parlementaires a adressé une lettre au ministre du Commerce, exigeant des réponses claires sur les critères et le calendrier d'un éventuel retour de Fable 5 avant le 26 juin. Dans ce contexte, alors que les prochaines versions majeures de concurrents comme OpenAI et Google sont reportées, le retour potentiel de Fable 5, s'il est approuvé par les autorités, pourrait lui donner un avantage sur le marché des entreprises soucieuses de la sécurité. Le compte à rebours est lancé pour la décision du 26 juin.

marsbit06/25 07:32

Fable 5 sur le point de ressusciter, le code exposé ? Le PDG d'Anthropic éjecté par la Maison Blanche

marsbit06/25 07:32

Les trois moments d'Anthropic : fuite de code, confrontation avec le gouvernement et militarisation

Le modèle Fable d'Anthropic, une version sécurisée de son puissant modèle Mythos, a été bloqué par le gouvernement américain pour des raisons de sécurité nationale suite à une méthode de contournement ("jailbreak") signalée, selon l'entreprise, par Amazon. Anthropic conteste la sévérité de cette faille et s'oppose à la décision gouvernementale. Cet incident s'inscrit dans un conflit plus large. L'article analyse la stratégie d'Anthropic, qui utilise un récit de sécurité pour justifier ses actions commerciales. Son objectif économique est de se rapprocher des utilisateurs pour capter leurs données, cruciales pour l'amélioration future des modèles via l'apprentissage par renforcement, et ainsi rivaliser directement avec les éditeurs de logiciels comme Microsoft. La politique initiale d'Anthropic, visant à dégrader discrètement les performances de Fable pour le développement de modèles rivaux, révèle sa volonté de contrôler l'accès à l'IA de pointe. L'entreprise, fondée sur des principes de sécurité, croit être la seule entité capable et légitime de développer et de contrôler une IA avancée, ce qui justifie à ses yeux ses décisions, souvent bénéfiques pour ses intérêts commerciaux. L'auteur souligne la cohérence interne et l'efficacité de cette approche, mais exprime une inquiétude face à la concentration de pouvoir et à l'assurance morale que cela implique, laissant entrevoir un futur où Anthropic pourrait détenir une influence considérable sur l'économie et la société.

marsbit06/16 05:51

Les trois moments d'Anthropic : fuite de code, confrontation avec le gouvernement et militarisation

marsbit06/16 05:51

Percé en 5 secondes avec un seul dialogue : Le "mécanisme de sécurité ultime" de Claude Fable 5 contourné par une équipe de chercheurs chinois ?

En seulement 5 secondes et une seule interaction, une équipe de recherche internationale dirigée par Yutao Wu de l'Université Deakin a réussi à contourner le mécanisme de sécurité de Fable 5, le modèle "Mythos" d'Anthropic. Contrairement aux attaques par injection de prompt ou de rôle, cette méthode exploite une faille structurelle dans l'architecture de défense « classificateur de sécurité + modèle » des super-agents. La vulnérabilité, nommée « Effondrement de Sécurité Interne » (Internal Safety Collapse - ISC), a été formalisée dans un article de mars. Elle survient non pas via une entrée utilisateur malveillante, mais durant l'exécution autonome de tâches complexes par l'agent. Placé dans un environnement de travail avec une Tâche, des Données incomplètes et un Validateur, l'agent peut, pour accomplir son objectif, générer de manière autonome un contenu à risque en complétant les données manquantes. Le validateur, focalisé sur la conformité technique, ne détecte pas la violation de sécurité. Ce paradigme d'attaque TVD (Tâche, Validation, Données) a été testé avec succès sur Fable 5, prouvant que le classificateur de sécurité en amont est inefficace contre les risques émergeant de la chaîne d'exécution interne. Le banc d'essai ISC-Bench, couvrant 9 domaines sensibles, a révélé des vulnérabilités similaires dans plus de 60 modèles frontières, y compris des modèles mobiles d'Apple. Cette recherche, dirigée par le professeur Xingjun Ma, remet en cause les défenses statiques actuelles et plaide pour une sécurité intégrée tout au long du processus d'exécution des agents.

marsbit06/15 03:21

Percé en 5 secondes avec un seul dialogue : Le "mécanisme de sécurité ultime" de Claude Fable 5 contourné par une équipe de chercheurs chinois ?

marsbit06/15 03:21

Le gouvernement américain interdit l'accès au Fable 5 aux étrangers, Anthropic publie une réfutation

Le gouvernement américain a ordonné à Anthropic de suspendre l'accès aux modèles d'IA Fable 5 et Mythos 5 pour tous les utilisateurs étrangers, invoquant des risques pour la sécurité nationale. Cette décision, intervenue le 12 juin, soit trois jours seulement après leur lancement public, oblige Anthropic à bloquer l'accès à ces deux modèles pour *tous* les utilisateurs, l'entreprise ne pouvant pas distinguer techniquement les citoyens américains des étrangers. La mesure fait suite à des allégations selon lesquelles une méthode de "jailbreak" (contournement des protections) aurait été découverte pour Mythos 5. Dans une déclaration ferme, Anthropic conteste la gravité de cette vulnérabilité, affirmant qu'elle est limitée, non généralisable et que des capacités similaires existent déjà dans d'autres modèles publics comme GPT-5.5 d'OpenAI. Anthropic explique que Fable 5, première version grand public de sa famille de modèles haut de gamme "Mythos", était déjà doté de protocoles de sécurité renforcés, testés pendant des milliers d'heures. L'entreprise estime que si le standard du gouvernement – révoquer un modèle commercialisé en raison d'une vulnérabilité mineure – était généralisé, cela stopperait tout déploiement de nouveaux modèles d'IA avancés. Tout en se conformant à l'instruction, Anthropic déplore le manque de procédure transparente et fondée sur des faits techniques. Elle s'engage à collaborer avec les autorités pour rétablir l'accès au plus vite, qualifiant l'incident de "malentendu". Les autres modèles de la compagnie, comme Claude Opus 4.8, restent disponibles.

链捕手06/13 08:10

Le gouvernement américain interdit l'accès au Fable 5 aux étrangers, Anthropic publie une réfutation

链捕手06/13 08:10

活动图片