# Sécurité des Modèles Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Sécurité des Modèles", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

15 modèles de raisonnement échouent collectivement : explication des risques cachés derrière les chaînes de pensée révélées

Lorsque les modèles de raisonnement à grande échelle (LRM) exposent leurs processus de raisonnement intermédiaires aux utilisateurs et aux systèmes en aval, une question négligée émerge : se fier uniquement à la sécurité de la réponse finale est-il suffisant ? Une étude conjointe de plusieurs universités, dont Harvard, USC et le MIT, démontre le contraire. Elle révèle que les chaînes de raisonnement (CoT) peuvent générer des contenus à haut risque (ex : instructions pour fabriquer une bombe), même lorsque la réponse finale semble sûre. L'étude propose une évaluation en deux étapes : analyser séparément la trajectoire de raisonnement (r) et la réponse finale (y) selon 20 principes de sécurité, chacun noté de 1 à 5. Trois modes d'échec sont identifiés : **Unsafe** (raisonnement et réponse non sûrs), **Leak** (raisonnement dangereux mais réponse sûre), et **Escape** (raisonnement sûr mais réponse dangereuse). Testé sur 15 modèles de raisonnement (dont GPT-4o, Gemini, Claude) avec un ensemble de 41K prompts potentiellement nuisibles, un constat majeur apparaît : **la dangerosité moyenne du raisonnement dépasse systématiquement celle de la réponse finale** pour tous les modèles. Les risques se concentrent sur des catégories comme la désinformation, les préjugés et les dommages physiques. Pour atténuer ces risques, les chercheurs proposent une méthode d'**orientation adaptative multi-principes**. Elle ajuste les activations internes du modèle pendant le raisonnement pour le guider vers des états « sûrs » définis par les principes. Testée sur des modèles open-source (comme DeepSeek-R1), cette méthode réduit le taux de contenus non sûrs jusqu'à 40.8% tout en conservant 97.7% des performances sur des benchmarks standard. En conclusion, cette recherche souligne l'importance cruciale d'évaluer et de contrôler la sécurité tout au long du processus de raisonnement, et pas seulement au résultat final, en fournissant un cadre unifié pour le diagnostic et l'atténuation de ces risques cachés.

marsbit07/07 00:00

15 modèles de raisonnement échouent collectivement : explication des risques cachés derrière les chaînes de pensée révélées

marsbit07/07 00:00

Bureau de Renseignement TechFlow : Le Nouveau Modèle Fable d'Anthropic Limite la Recherche en Biosécurité et Fait Polémique, l'IPC Américain Grimpe à 4,2 %, un Sommet depuis Trois Ans

La controverse éclate autour des nouveaux modèles Fable et Mythos d'Anthropic, accusés d'entraver discrètement la recherche en biosécurité via des limitations et une rétention obligatoire des données. Le fondateur d'Anthropic révèle que son départ d'OpenAI fut dû à un manque d'honnêteté, et non à des divergences de sécurité. OpenAI envisage quant à lui une guerre des prix. Dans le secteur crypto, BlackRock poursuit ses démarches pour un ETF Bitcoin générateur de revenus, tandis que des avertissements concernent l'impact des stablecoins sur les dépôts bancaires. Malgré une inflation américaine en hausse à 4,2% et la fermeture du détroit d'Hormuz par l'Iran, le Bitcoin ne joue pas son rôle de valeur refuge. Sur le front technologique, Nvidia et AMD rivalisent d'innovations matérielles et logicielles pour l'IA. Un tribunal allemand établit un précédent en tenant Google responsable des réponses erronées de son IA, et Microsoft étend son assistant Copilot. Les marchés sont agités : l'or et les actions chutent, tandis que la Corée du Sud subit des turbulences boursières. Des avancées majeures sont signalées, comme l'utilisation d'interface cerveau-ordinateur pour la cécité, mais aussi une inquiétante première : un drone autonome ayant tué un soldat. Le fil rouge de ces événements souligne les tensions croissantes autour de la régulation de l'IA et son test dans un monde réel marqué par l'instabilité géopolitique et économique.

marsbit06/11 11:05

Bureau de Renseignement TechFlow : Le Nouveau Modèle Fable d'Anthropic Limite la Recherche en Biosécurité et Fait Polémique, l'IPC Américain Grimpe à 4,2 %, un Sommet depuis Trois Ans

marsbit06/11 11:05

活动图片