# 越狱的所有文章

在 HTX 新聞中心流覽與「越狱」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

Anthropic造了套AI越狱「刑法」:你的请求,四种死法

近日,Anthropic公布了其AI安全系统Fable的详细拦截规则,并将用户请求分为四类进行管理:明确禁止的恶意行为(如勒索软件)、高风险双用途行为(如渗透测试)、低风险双用途行为(如漏洞扫描)以及理论上无害的行为(如调试代码)。然而,该系统因“宁可错杀,不可放过”的原则,导致大量正常请求被误拦截,引发了用户不满。 为更系统化地评估安全风险,Anthropic联合Glasswing联盟推出了“网络越狱严重性框架”(CJS)。该框架从能力增益、能力广度、武器化难度和可发现性四个维度对AI越狱行为进行0-10分的量化评分,并划分严重等级。CJS旨在为模型下架等决策提供“客观”依据,但其评分标准由Anthropic及其盟友主导制定,引发了对规则制定权垄断的担忧。 文章指出,此前Fable 5模型因美国出口管制政策被全球断服,标志着监管首次直接作用于模型API。如今,重新上线的模型已配备更严格的过滤系统。而更强大的Mythos模型仅对特定合作机构开放,形成了“技术分层”的管控格局。在此背景下,CJS框架也被视为递给监管者的“行刑尺”。 对于普通用户,文章建议在提示词中避免敏感词汇、注意模型降级信号,并耐心等待系统优化。最终,AI能力的边界已不纯粹是技术问题,更受到了商业策略与地缘政治规则的双重塑造。

marsbit07/06 00:24

Anthropic造了套AI越狱「刑法」:你的请求,四种死法

marsbit07/06 00:24

活动图片