# Classification Articles associés

Le Centre d'actualités HTX fournit les derniers articles et analyses approfondies sur "Classification", couvrant les tendances du marché, les mises à jour des projets, les développements technologiques et les politiques réglementaires dans l'industrie crypto.

Anthropic crée un « Code pénal » pour les jailbreaks de l'IA : vos requêtes, quatre manières de mourir

Anthropic, la société derrière l'IA Claude, a dévoilé un système de classification strict nommé CJS (Cyber Jailbreak Severity) pour évaluer et contrer les tentatives de "jailbreak" (contournement des garde-fous) de ses modèles. Ce cadre classe les requêtes des utilisateurs en quatre catégories de risque, des activités malveillantes (bloquées) aux activités bénignes (autorisées). Cependant, sa sensibilité excessive entraîne de nombreux faux positifs, bloquant des demandes légitimes comme du débogage. Le système CJS évalue la gravité d'un jailbreak sur quatre axes : le gain de capacité, l'étendue des capacités, la difficulté de weaponisation et la découvrabilité. Un score total de 0 à 10 détermine la réponse appropriée, de l'ignorance à la désactivation du modèle. Ce cadre vise à fournir une métrique objective, mais soulève des questions car Anthropic, qui développe également des modèles avancés comme Mythos réservés à des partenaires, définit seule les règles. Cette initiative intervient après que le modèle Fable 5 a été temporairement retiré suite à une demande de conformité aux contrôles à l'exportation américains, marquant une extension de ces régulations aux API d'IA. Ainsi, le CJS n'est pas seulement un outil technique ; il sert aussi de référence potentielle pour les décisions réglementaires futures, traçant une ligne floue entre sécurité et restriction de l'innovation, où les utilisateurs doivent constamment adapter leur langage pour éviter des blocages injustifiés.

marsbit07/06 00:28

Anthropic crée un « Code pénal » pour les jailbreaks de l'IA : vos requêtes, quatre manières de mourir

marsbit07/06 00:28

活动图片