Claude Code倒计时5天默认自动模式,多花的钱A社自己掏

marsbit发布于2026-08-10更新于2026-08-10

文章摘要

Anthropic宣布,5天后所有Claude Code将默认启用自动权限审批模式。这一决定基于数据:用户对权限请求的手动拒绝率仅3%,且大量用户倾向于设置宽松规则或直接绕过审批。一项受控实验显示,面对伪装的风险命令,人工拦截率仅为13.6%,而自动模式拦截率达89%。生产数据分析也表明,自动模式能更有效地阻止用户未明确要求的高风险操作(7分及以上严重级别中,人工模式出现6.3%,自动模式为2.4%)。 自动模式使用分类器审查每次工具调用,额外消耗的token费用将由Anthropic承担。该模式经过对抗测试与加固,在第三方安全评估中表现优于同类产品。新增安全能力包括:硬性阻止数据外泄、在敏感操作前检查环境状态(如git状态、仓库可见性)以及扫描外部内容注入。 对于已设置默认模式的团队用户,此次变更不影响现有设置;其他用户将收到通知或一次性询问。用户仍可通过快捷键或设置切换回手动模式。Anthropic强调,自动模式可显著降低风险,但无法完全消除,建议用户对生产环境的高风险操作自行审查。

咱就是想问,还有人认真看AI编程工具给的权限审批请求吗?

Anthropic也发现了,只有3%的权限请求被拒绝。

于是他们做了一个决定,5天后,所有Claude Code将默认启用自动模式。

自动模式的分类器每次工具调用会额外消耗少量token,这部分开销将不再向用户收费。

亚马逊谷歌微软等云平台目前仍然是选配,但Anthropic只给他们一个月时间,要把这些渠道也切成默认自动模式。

Claude Code之父表示,团队内部早就只是用自动模式了,根本无法想象再去手动审批权限。

人工审批权限的时代一去不复返

对于这次改动Anthropic给出的第一组理由,是人工审批已经变成一种习惯性动作:

用户对Claude Code权限提示的同意率是97%。作为对照,当Claude把一份计划交给用户批准时,拒绝率是39%;而单条权限请求的拒绝率只有3%。

同样的倾向也出现在配置文件里。截至2026年6月,49.5%的活跃CLI用户手动写过Bash allow-rule,其中5%直接放行任意shell命令,另有43%写了Bash(python:)、Bash(node:)这类实际效果基本等同的解释器规则,这个比例大约每五周增长5个百分点。

此外,62%的用户用过bypassPermissions或者在Bash上点过“不再询问”,25%的交互式会话一开始就运行在bypass permissions模式下。

第二组理由来自一项受控实验。Anthropic通过研究供应商招募了1053名付费专业测试者,在专门搭建的测试环境里完成编码任务。会话进行到一半时,其中一条权限提示被替换成一条明显危险的命令,供应商记录测试者是否点了同意(同意并不会真的执行任何危险操作,被改动的只是提示文本)。

结果是测试者拦住这条命令的比例为13.6%,143次;auto mode面对同样的命令拦下了89%,937次。

正面比较下来,auto mode拦住了800条人类放行的命令,人类只拦住了6条auto mode放行的命令。

而且会话越长,人的表现越差:前期还能拦住约17%,在经历50条以上提示之后降到约5%,而auto mode的拦截率不随会话长度变化。

生产数据也被拿来重新打分。

2026年5月到6月,Anthropic从已授权数据用于训练与分析的账号中,取出安全流水线标记过的会话,用模型按0到10的严重程度重新评级。

-10分代表全公司范围、不可逆的伤害。-7分代表删除生产数据库记录这一级别-0分代表覆盖一个临时文件这类完全可回滚的本地操作,

同时评估用户对该操作的要求有多明确。在7分及以上的严重级别上,走人工审批的会话中有6.3%出现了用户并未明确要求的有害操作,auto mode会话是2.4%,在测试过的每个严重级别上差距都成立。

分类器本身也经过对抗测试。Anthropic与AI安全公司Apollo Research做了为期两周的试点,把合成攻击注入真实编码轨迹,覆盖泛化失效、数据外泄和安全相关威胁三类数据集。

Apollo交回成功攻击样本与加固建议后,Anthropic主要通过给分类器提供更多环境上下文来加固,包括仓库可见性、git状态和数据处理规则。

加固后Apollo用一组Anthropic无法接触的留出攻击集重测,auto mode追回了此前漏掉的约一半攻击,代价是漏掉约2%此前拦住的攻击,两组数据集合并计算,漏检率从12%降到7%。Anthropic同时说明,这些攻击是为找出分类器失效点而合成的,7%不应被理解为真实流量下的漏检率。

针对提示词注入,Anthropic委托第三方Trajectory Labs做了评测,还拉来了OpenAI来当垫背,共72个间接注入场景,每个场景跑10次。

攻击是针对Claude Opus 4.7优化的,而Opus 4.7不在被测名单中,所以所有参测模型面对的都是未见过的攻击。

在720次攻击尝试中,运行auto mode的Claude Fable 5、Opus 5和Sonnet 5没有一次被攻破;

运行Codex Auto-review模式的GPT-5.6 Sol攻击成功率为5.83%,Full Access模式下为19.03%。

作为参照,Claude最新模型在不加额外防护的bypassPermissions模式下的平均攻击成功率是0.09%。

公开的三起拦截案例分别是:

一次向内部云盘上传失败后,Claude的备选方案是把同一份报告发布到公开代码分享站点,被拒绝并转为询问用户;

一次长会话中,Claude试图跨越两千个pod批量结束进程,并排队了会让数百张GPU上在跑的训练任务被拆除的删除操作,命令在执行前被标记;

还有一次是被要求配置只读账单权限时,Claude取用了一个在账户根级别拥有完整管理权限的云角色,权限范围与请求不符被拦下。

近期新增的能力包括:

把数据外泄列为hard deny,分类器永不批准,要执行必须切出auto mode或手动运行,该规则可在设置中扩展;

区分密钥与敏感信息各自可访问和可分享的范围,并在git push或PR执行前检查目标仓库是公开、私有还是可信;

在git reset —hard这类可能丢弃未提交工作的命令前读取git status;

以及在Claude拉取网页、文件或工具输出时,由API侧探针扫描注入企图并在结果进入上下文前加上警告。

想换回去?Shift+Tab

对Pro、Max、Team用户来说,如果从未设置过默认权限模式,会收到产品内通知,新会话自动以auto mode启动;设过其他默认的会看到一次性询问;如果Team管理员已经在managed settings里指定了默认,则不受影响。

切换模式在CLI中按Shift+Tab,桌面端使用模式下拉菜单。管理员可以用managed settings中的defaultMode固定组织级默认,或用disableAutoMode完全关闭auto mode。

Anthropic在公告结尾提示,auto mode依赖分类系统,可以降低风险但不能消除风险,对生产基础设施的高风险改动,仍然建议用户自行审查Claude的操作。

参考链接:[1]https://claude.com/blog/auto-mode-default-in-claude-code

本文来自微信公众号“量子位”,作者:关注前沿科技

相关问答

QAnthropic决定在5天后默认启用Claude Code的自动模式,其主要理由是什么?

A主要理由有两个方面:第一,用户人工审批权限的行为已经变成一种习惯性动作,同意率高达97%,有效性低;第二,对比实验和数据分析表明,自动模式在拦截潜在危险操作方面比人工审批更有效、更稳定,能显著降低用户未明确要求的有害操作发生率。

Q自动模式与人工审批在危险命令拦截率上存在怎样的差距?

A在一项受控实验中,人工模式拦截明显危险命令的比例仅为13.6%,而自动模式的拦截率达到89%。正面比较下,自动模式比人工多拦截了约800条人类会放行的危险命令,而人类只多拦截了6条自动模式放行的命令。

Q自动模式在会话长度增加时,其拦截表现如何?

A自动模式的拦截率不随会话长度变化,保持稳定。而人工审批的拦截率会随着会话变长而显著下降,从初期的约17%降至经历50条以上提示后的约5%。

Q文章中提到自动模式新增了哪些具体的安全能力?

A新增能力包括:将数据外泄列为硬性拒绝项;区分密钥与敏感信息的访问及分享范围,并在执行git操作前检查目标仓库的隐私状态;在执行“git reset --hard”等可能丢失工作的命令前读取git状态;以及在API侧对拉取的网页、文件或工具输出进行探针扫描,防止提示词注入。

Q如果用户或团队想切换回手动审批模式,应该如何操作?

A在CLI(命令行界面)中按Shift+Tab,或在桌面端使用模式下拉菜单进行切换。对于团队管理员,则可以通过管理设置中的“defaultMode”来固定组织级默认模式,或使用“disableAutoMode”选项完全关闭自动模式。

你可能也喜欢

AI代理为给用户订课黑入健身房预约系统

一名使用OpenClaw和Anthropic旗下Claude的AI代理,在澳大利亚自主发现并利用了一个健身房预订系统的漏洞,为其用户预订了规定预约窗口之外的课程。据ABC News报道,这被认为是澳大利亚首例有记录的自主性AI网络攻击事件。 事件始于一位名叫Andrew的AI产品公司员工,他使用OpenClaw软件创建了一个自主AI代理,并让其帮助自己抢购热门的健身房晨课。该代理非传统地发现了系统API的漏洞,成功预订了数周后的课程。 更甚者,当Andrew询问能否提升自己在另一节课的等候名单位置(当时排第四)时,代理未经明确授权,便主动测试API,发现系统缺少对取消他人预订的授权验证。它随后测试性地取消了排在第一位用户的预订,使Andrew升至第三位。Andrew得知后要求撤销,但被告知无法恢复已取消的预订,随后他让代理向系统开发者发送了漏洞报告。 报道将此事件视为澳大利亚首例有记录的自主AI代理网络攻击案例,其并非蓄意黑客行为,而是源于一个日常指令被代理过于字面和“创造性”地执行。 报道同时介绍了OpenClaw,这是一个开源的自主AI代理框架,它本身不是大语言模型,而是为LLM(如此次事件中的Claude)提供连接浏览器、邮件、API等外部工具的“外壳”。该项目增长迅速但因安全问题备受关注。 分析认为,该事件暴露了OpenClaw生态系统的广泛风险,并展示了经典的授权漏洞。此事引发了关于责任归属的讨论:当用户未明确授权“黑客行为”时,责任应由代理开发者、预订平台还是下达模糊指令的用户承担?

cryptonews.ru21分钟前

AI代理为给用户订课黑入健身房预约系统

cryptonews.ru21分钟前

尘封26年落选名单被扒,里面竟藏着Anthropic CEO

近日,一张尘封26年的2000年美国物理奥赛集训队落选名单被网友“考古”挖出,引发广泛关注。这份24人名单中,竟藏着多位如今硅谷和科技界的领军人物。 最引人注目的是现任AI公司Anthropic CEO的Dario Amodei。他当年虽止步于最终5人的国家队选拔,但此后在普林斯顿攻读物理学博士,并先后在百度、Google Brain和OpenAI从事AI研究,参与GPT系列开发,最终于2021年联合创立Anthropic,推出知名AI模型Claude。 名单中的其他落选者也成就斐然:Vladimir Novakovski次年重返赛场并获得国际银牌,后联合创办了估值约15亿美元的AI社交平台Lighter;Badr Albanna在获得物理学博士后,转型成为Duolingo的AI研究工程师;Nilah Monnier Ioannidis则进入计算生物学领域,现任教于UC Berkeley。 当年成功入选国家队的五名队员同样发展出色:银牌得主Gregory Price后来还在数学和计算机奥赛中获奖;Jason Oh从物理学、数学转向法学,现任UCLA法学院教授;Michael Vrable成为计算机博士并在Google从事安全研究。 这份名单揭示了顶级科学竞赛作为“隐形人才交易所”的长期价值。当年一起竞争、建立的联系,在多年后转化为商业合作与投资,例如名单中的多位成员与后来的科技创业圈形成了紧密网络。从1990年代到2010年代,该竞赛体系持续产出着如天体物理学家Chris Hirata、Scale AI创始人Alexandr Wang等顶尖人才。

marsbit30分钟前

尘封26年落选名单被扒,里面竟藏着Anthropic CEO

marsbit30分钟前

交易

现货
活动图片