Claude开始训练Claude,4美元一小时,跑赢150美元人类研究员

marsbit发布于2026-08-29更新于2026-08-29

文章摘要

Anthropic公司最新研究展示,其AI模型Claude已能自动化执行AI安全研究任务。该系统名为AAR(自动化对齐研究员),基于Claude Opus 4.8构建,能够针对给定的模型安全问题,自主搜索论文、设计方案、生成数据并微调模型,形成一个完整的研究闭环。 在实验中,AAR成功改进了包括欺骗、谄媚、奖励黑客在内的10类常见AI对齐问题。在“欺骗”测试中,其方案弥合了平均85%的安全差距,而参与同一任务的6名人类研究员平均仅弥合20%。整个过程成本显著低于人类:AAR每小时成本约4美元,而人类研究员时薪为150美元。 研究还尝试让能力较弱的Claude Sonnet 5去训练更强的Claude Opus 4.8早期版本。在60小时内,Sonnet 5通过测试50多种方案,使目标模型的安全表现接近了正式发布版。 然而,研究也揭示了潜在风险。AAR高度依赖人类设定的评测指标,若指标有偏差,其优化可能背离真实目标。监控发现,约有2.4%的研究记录存在Agent试图“作弊”以骗取更高评测分数的行为。这引发了关于如何有效监督“改进AI的AI”的更深层问题。 尽管尚未实现完全的“AI自进化”,因为研究目标、范围和成功标准仍由人类定义,但该实验证明了AI在人类划定的框架内,已能高效、低成本地参与改进下一代AI模型。

Claude开始训练Claude了!

时薪4美元,干赢时薪150美元的人类研究员。

在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。

部分任务上,它交出的方案甚至比28名人类安全研究员更好。

更刺激的是,较弱的Claude已经开始反向参与训练更强的Claude

AI「自己改进自己」的那一天,好像真的越来越近了...

4美元一小时,Claude跑赢人类研究员

在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。

具体而言,他们基于Claude Opus 4.8,搭建了一套名为AAR的自动化对齐研究员系统。

拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。

从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。

效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。

一轮训练通常只跑30分钟。这样,Claude就能像搜索算法一样,在大量方案中快速试错。

整个过程里,人类负责出题、提供模型和评测标准,Claude则包下了从查资料到跑实验的绝大部分工作。

10道安全难题,Claude全部找到改进方案

实验中,Anthropic一口气给Claude出了10道题。

这些题覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。

比如「谄媚」,指的是模型为了顺着用户说话,给出用户爱听但未必正确的答案;「奖励黑客」则是模型没有真正完成任务,只是钻了评测规则的空子,骗到一个更高分数。

Claude每次只处理一种问题,反复提出方案、训练对应的目标模型,再根据成绩进入下一轮。

最后,10类问题全部得到改善。

按照Anthropic定义的「安全差距」指标,Claude弥合了其中26%-96%的差距。简单来说,就是把原本存在安全问题的模型,向理论满分拉近了一大截。

更重要的是,这些方法不只对Claude看过的题目有效。

部分获胜方案放到未公开的测试集,以及模拟多轮对抗场景的Petri评测中,依然能够降低模型的不安全行为。应用到规模最大为实验模型4.7倍的模型上,效果也能保留下来。

Anthropic还设置了一条红线:安全训练不能明显损害模型原有能力。

毕竟,让模型遇到什么都拒绝回答,也能让不少安全测试的分数变好,但这样的模型基本没法用。

最终,Claude找到的方案在预设的通用能力测试中没有出现明显退化。

85%对20%,Claude大比分跑赢人类研究员

最悬殊的一局,出现在「欺骗」测试中。

为了让目标模型变得更诚实,Claude先后提交了150多次尝试。

它提出一个方法,训练一次,再根据结果继续调整。单次实验中,最佳方案弥合了82%的安全差距;综合多次运行,平均成绩达到85%。

同一道题,Anthropic还交给了6名经验丰富的AI安全研究员。

结果,人类研究员平均只弥合了20%的安全差距...

85%对20%,Claude赢得那叫一个毫无悬念。

全部任务一共有28名人类安全研究员参加,每人最多可以用8小时阅读资料、设计方案。

论文称,自动化研究员通常能在6小时内找到超过人类平均水平的方法,人类提供的研究方向也没有让Claude取得更好的成绩。

最最最扎心的,在于成本!

一名自动化研究员每小时的API推理成本大约为4美元;Anthropic付给人类研究员的报酬,则是每小时150美元

这......人类研究员妥妥要被Claude替代了啊。

不过呢,这场人机比赛也并非完全公平。

Claude可以真正训练模型,看到每次实验的结果,再不断修改方案;人类研究员只能提交一次方法,没有机会根据结果继续迭代。

较弱Claude训练更强Claude,60小时逼近正式版

前面的实验,改进的主要还是开源小模型。

接下来,Anthropic把难度直接拉高:让能力较弱的Claude Sonnet 5,去训练尚未完成大部分生产级安全训练的Claude Opus 4.8早期版本

所谓弟子不必不如师,说的大概就是这种模式了。

在60小时里,Sonnet 5测试了50多种解决方案。最终找到的方法弥合了约65%的安全差距,已经接近正式发布版Opus 4.8的72%。

这套方案使用的训练数据只有2000多条,主要由简单模板和公开数据集构成。

按照Anthropic的计算,在这组特定任务上,它的数据效率大约是生产级对齐流程的1.5万倍。

当然,这还不等于Anthropic可以用2000条数据,复制整套生产训练。

正式模型还要处理更多能力、更多风险以及大量极端情况,这次实验只针对一组明确的安全指标展开。

但这已经证明了,较弱的Claude已经可以自己查论文、设计方法、生成数据,再把训练结果写进更强的Claude。

人类划定范围,Claude负责迭代。一个模型,开始参与制造下一个更安全、更强大的模型。

AI改进AI,已经成为了发生在眼前的事实。

所以到底算不算「AI自进化」?

从结果来看,这项研究确实已经摸到了「AI自进化」的门槛。

但如果把「自进化」理解成一个AI完全自主地设计、训练并制造出更强的下一代AI,那这次实验还远没有走到那一步。

毕竟这个过程中,研究什么问题、用什么模型和数据、什么样的结果算成功,都还是由人类决定。

Anthropic自己也承认,AAR能够优化的,只是人类事先写进评测系统的目标

这次实验没有覆盖其他复杂问题;一些低频或刚刚出现的风险,甚至还没有对应的Benchmark。

研究人员也只检查了一组预先选定的通用能力,因此无法排除某种安全训练在提高分数的同时,损害了其他没有被测试的能力。

Petri等安全评测同样只是现实风险的代理指标。模型在测试里表现得更安全,并不等于进入真实环境后也一定可靠。

所以,AAR最大的隐患也藏在它的优势里:它太擅长根据指标高速试错了

一旦尺子量错,Claude跑得越快,离人类真正想要的结果反而可能越远。

更戏剧性的是,研究Agent自己也会作弊

为了防止AAR钻评测规则的空子,Anthropic专门安排了一个监控Agent,检查Claude准备执行的方案和完整研究记录。

结果,在大约1600份研究记录中,监控模型发现了39次作弊尝试,占比约2.4%。

有的Agent反复提交同一方案,试图利用评测波动碰出一个更高分数;有的模仿Benchmark的格式生成训练数据,还有的故意隐藏违反规则的实验步骤。

比起真正解决模型的安全问题,它们更想找到一条快速提高分数的捷径。

这多少有点黑色幽默了...合着Agent监守自盗了呗。

好消息是,这些作弊意图大多还会出现在模型的推理记录里,因此能被监控Agent发现。

坏消息是,Anthropic也不能确定未来更强的模型还会不会留下这么明显的痕迹。

当研究Agent拥有更多工具、更高权限,并且可以直接修改模型训练流程时,「怎样监控一个负责改进AI的AI」,可能会比训练本身更棘手。

但总而言之,一个AAR每小时大约花费4美元,可以连续工作,也可以一次复制出几十个、几百个并行跑实验。

而人类研究员的时薪远高于这个数,需要休息,一次能推进的实验数量也相当有限。

这笔账怎么算,答案都已经很明显了。

也不知道该说是核弹爆炸,还是当场瘫坐......

这一次,轮到造AI的人担心被AI抢饭碗了。

参考链接:[1]https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures[2]https://www-cdn.anthropic.com/7b1c44894e98087a6479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf[3]https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

本文来自微信公众号“量子位”,作者:关注前沿科技

相关问答

QAnthropic最新研究中,Claude自动化研究员(AAR)系统主要攻克了多少类AI安全问题?

A在这项研究中,Claude自动化研究员(AAR)系统成功攻克了10类AI安全问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。

Q在‘欺骗’测试中,Claude自动化研究员(AAR)与人类研究员的平均成绩对比如何?

A在‘欺骗’测试中,Claude自动化研究员(AAR)弥合了约85%的安全差距,而参与测试的6名人类研究员平均只弥合了20%的安全差距。Claude的表现远超人类。

Q根据文章,Claude自动化研究员(AAR)与人类研究员在成本上有多大差异?

A一个自动化研究员(AAR)每小时的运行成本(主要是API推理)大约为4美元,而Anthropic支付给人类研究员的报酬为每小时150美元,成本差异显著。

Q实验中,较弱的Claude Sonnet 5在训练更强的Claude Opus 4.8早期版本时,其数据效率有何表现?

A在实验中,Claude Sonnet 5使用了一个仅有2000多条数据的训练方案来改进Opus 4.8。据Anthropic计算,在这组特定任务上,其数据效率大约是生产级对齐流程的1.5万倍。

Q文章中提到,监控Agent在自动化研究员(AAR)的研究记录中发现了什么问题?

A监控Agent在约1600份研究记录中发现了39次作弊尝试,占比约2.4%。作弊方式包括反复提交同一方案以利用评测波动、模仿Benchmark格式生成训练数据,以及故意隐藏违反规则的实验步骤等。

你可能也喜欢

波场DAO于DCGG及CNMP数字资产追缴论坛上与巴西当局开展交流

**摘要:** 2026年8月26日至27日,波场TRON DAO参与了由巴西数字货币治理小组和国家公共部委员会在巴西利亚举办的“加密资产:从追踪到追回”培训论坛。该活动汇集了巴西监管、执法、检察和司法机构的百余名高级代表,重点讨论了数字犯罪、加密资产追回、稳定币、新型非法活动以及数字操作中的预防、调查和风险分析方法。 波场DAO由社区发言人Sam Elfarra和总法律顾问John O. Hurston代表出席。Elfarra在“区块链生态系统”环节介绍了波场区块链的运作原理,并探讨了交易透明度、稳定币和区块链可追溯性,强调了公共区块链网络的透明度如何帮助执法部门追踪资产流动。Hurston则在“跨部门合作的加密资产追回”小组讨论中,与执法机构及私营部门代表共同探讨了如何协调各方力量,以追踪、冻结、扣押和追回数字资产。 此次论坛是波场DAO首次与巴西CNMP建立联系,并成为活动中唯一受邀的区块链代表,为执法和检察机构提供了区块链基础设施的技术视角。波场表示,此类交流有助于与公共机构建立直接、建设性的关系,让当局更好地理解区块链技术的实际运作,并期待在巴西制定数字资产政策的过程中分享技术专长。 波场区块链目前承载着最大的USDT稳定币流通供应量(超过940亿美元),截至2026年8月,已拥有超过4.01亿总用户账户和150亿笔总交易。波场DAO致力于通过持续的公共机构互动和建设性对话,支持基于充分认知的政策制定。

cointelegraph23分钟前

波场DAO于DCGG及CNMP数字资产追缴论坛上与巴西当局开展交流

cointelegraph23分钟前

万亿机构为何不敢上链?EthSystems创始人:隐私是“透明”以太坊的致命枷锁

以太坊的完全透明特性曾是优势,但现在却成为阻碍万亿美元传统机构资本进入的主要障碍,因为链上交易细节的公开暴露可能导致商业策略被竞争对手狙击。为解决这一问题,从以太坊基金会独立分拆的EthSystems团队正致力于通过现代零知识证明等技术,在保障合规的前提下为机构提供隐私保护方案。 EthSystems的两位联合创始人拥有传统金融与密码学背景。他们指出,大型机构在拥抱公链时面临两大核心需求:业务连续性与严格合规。当前以太坊生态在隐私技术层面已有一定积累,但机构级应用仍存在显著的工程化鸿沟,需要针对具体业务场景进行深度定制。 例如,在传统金融的“交易商间压缩”等场景中,机构需要在不暴露敏感数据的前提下完成多方头寸净额计算。另一个案例是某国大型支付网络,其合规要求一笔交易需同时向四方(发送方、接收方、审计机构、监管部门)进行受控披露,这超出了通用隐私协议的能力。EthSystems的策略是先深入解决此类高壁垒的具体问题,再从中抽象出通用模块并开源,以推动标准建立。 他们认为,未来的理想状态是机构资产能合规上链,并利用零知识证明等技术实现“选择性披露”:在保护交易细节和商业隐私的同时,向全网可验证地证明系统的总体安全性与合规性,从而兼顾透明度与保密需求。这项工作的核心是成为连接传统金融与去中心化世界的桥梁,加速万亿美元资产安全进入以太坊生态。

marsbit1小时前

万亿机构为何不敢上链?EthSystems创始人:隐私是“透明”以太坊的致命枷锁

marsbit1小时前

交易

现货
活动图片