Anthropic警告的递归AI,田渊栋新公司刚刚走出了「第一步」

marsbit发布于2026-06-12更新于2026-06-12

文章摘要

近日,Anthropic发布文章披露,其代码库超过80%由AI撰写,并警告AI“递归自我改进”(即AI自主设计、训练后续版本)可能带来风险,呼吁行业建立暂停机制。与此同时,由田渊栋等人联合创立的新公司Recursive Superintelligence结束了隐身状态,发布了其首项公开技术成果——“迈向自动化AI研究的第一步”。 该系统旨在将传统AI研究中“提出想法-编写代码-运行实验-分析结果”的人工闭环自动化。它能够针对给定目标自动生成实验思路、实现代码、运行验证并从中学习,从而自主推进研究进程,并内置了防止“奖励作弊”的机制。 Recursive在三个差异显著的基准测试中取得了领先结果: 1. **小模型训练优化**:在固定计算预算下,将模型验证损失进一步降低,相当于以更少时间达到同等效果。 2. **训练速度竞速**:在社区持续优化两年的基准上,将训练时间从79.7秒缩短至77.5秒,核心改进包括在注意力层使用FP8计算、为优化器添加退火噪声等。 3. **GPU内核优化**:在英伟达的底层计算内核基准测试中,将整体得分提升至0.754,缩小了与硬件理论极限的差距,而这些优化策略并非来自团队的专业知识,而是由系统自主发现。 Recursive团队阵容强大,已获得巨额融资,其目标是构建能够递归提升自身研发能力的AI系统。这与Anthropic的警告形成了微妙对比:一方正在实践AI加速AI研发的路径,另一方则呼吁为可能到来的“递归自我改进”时刻做好风险管控准备。当前成果虽仅是迈向自动化研究的初步尝试,但标志着一个能够自我增强的AI研发新范式已开始运转。

前些天,Anthropic 发布了一篇题为「When AI Builds Itself」(当 AI 构建自身)的文章,迅速引发广泛讨论。文章揭示了一组令人侧目的内部数据:截至 2026 年 5 月,Anthropic 代码库中超过 80%的代码已由 Claude 撰写,工程师每日合并的代码量是 2024 年的 8 倍;在一项内部测试中,Claude 将一段训练代码的运行速度从基准提升了约 52 倍,而一名有经验的人类研究员通常需要 4 到 8 小时才能达到 4 倍加速。

Anthropic 将这条轨迹指向一个更深的目的地:「递归自我改进」——AI 系统自主设计、构建和训练自身后继版本,人类不再驱动每一步。值得关注的是,该公司还呼吁行业协调,在递归自我改进时刻到来时拥有暂缓乃至临时叫停前沿 AI 开发的选项。并且 Anthropic 已经在这么做了:限制最新的 Claude Fable 5 被用于研发前沿 AI。

而现在,Recursive Superintelligence 宣布向自动化 AI 研究走出了第一步

这家由田渊栋联合创立的新公司刚刚结束隐身状态仅一个月,如今就发布了第一项公开技术成果。他们打造了一个开放式的自动化知识发现系统,并在三个基准测试上取得了 SOTA 结果。简单来说,他们成功做到了让 AI 替你跑实验。

https://x.com/tydsh/status/2065062838255649082

第一步成果:让 AI 替你跑实验

Recursive 这第一项公开技术成果名为「First Steps Toward Automated AI Research」(迈向自动化 AI 研究的第一步)

推文:https://x.com/Recursive_SI/status/2064980090702962699

仓库地址:https://github.com/recursive-org/first-steps-toward-automated-ai-research

博客地址:https://www.recursive.com/articles/first-steps-toward-automated-ai-research

如果用一句话概括,这项工作的核心是:构建了一套能自主推进 AI 研究循环的系统,并在三个基准测试上刷新了最好成绩。

在正式拆解成果之前,有必要先理解这套系统的设计逻辑。

传统的 AI 研究流程是一个高度依赖人的「提想法—写代码—跑实验—分析结果—再提想法」的闭环。它的效率瓶颈不在算力,而在人。全世界能设计前沿训练流程的研究员屈指可数,而每一轮实验迭代都需要他们高度介入。

Recursive 的系统试图把这个闭环自动化。

它的工作方式是:针对一个明确的优化目标,系统自动提出实验想法、实现代码、运行验证、从中学习,然后决定下一步怎么搜索。多条研究线路可以并行推进,有效的发现可以被跨任务复用,奖励作弊(reward hacking)的检测机制也被内嵌进整个循环,防止系统「走捷径」把测评指标刷上去却没有真正改进任何东西。

这并非一个针对单一问题微调的专用工具,乃是一套跨领域的通用研究自动化框架。 Recursive 用三个差异显著的测试场景来证明这一点。

三个战场,三个新纪录

场景一:固定计算预算下的小模型训练(NanoChat Autoresearch)

这项基准测试的规则来自 Andrej Karpathy(GPT-2 作者、前 OpenAI 联创)发起的 autoresearch 项目:在一块 GPU 上,给定五分钟的固定训练预算,尽可能把一个小型语言模型训到最低的验证损失(以 BPB 衡量,越低越好)。

这个场景天然适合自动化研究:实验周期短、指标方差低、作弊行为相对容易检测。正因如此,一个名为「autoresearch@home」的社区项目已经在这个基准上运行了很长时间——数十名人类研究员加上数百个 AI 智能体协作,持续把指标往下压。

Recursive 的系统以相同的初始代码出发,最终把验证 BPB 从社区最佳的 0.9372 推进到了 0.9109,改善了 0.0263 个 BPB。换算成另一种说法:同样的训练质量,Recursive 的方案只需要对手 1.3 倍少的训练时间就能达到。

系统发现的改进并非一招制胜。它组合了架构调整、辅助损失、注意力机制改动、优化器行为、权重衰减调度、编译器设置等多处变化。其中最关键的一个发现,是一种更丰富的短上下文记忆机制:在注意力的 value 路径中,通过哈希表同时嵌入 bigram(相邻词对)和 trigram(三元组)信息,并用可学习的门控加权混合。不同的 Transformer 层使用不同的哈希函数,从而降低跨层重复碰撞的概率。

这个技巧在概念上与 DeepSeek Engram 等工作有所关联,但系统将其以一种尚未见于公开文献的特定变体形式部署到了固定预算场景中。

场景二:训练速度极限竞速(NanoGPT Speedrun)

如果说前一个场景是在一个活跃社区的成果上「再进一步」,这个场景则难得多。

NanoGPT Speedrun 是另一个由 Karpathy 发起、社区持续优化两年以上的基准:在 8 块 H100 GPU 上,把一个 GPT 模型训练到验证损失 3.28 所需的最短时间。自 2024 年中以来,社区已通过 83 次有记录的贡献把时间从约 45 分钟压缩到了 79.7 秒。每一个新方案都需要在极度优化的代码基础上再挤出时间,难度可想而知。

Recursive 的系统从现有最优解出发,再次把训练时间压缩到了 77.5 秒,节省了 2.2 秒。这与近期人类贡献者能做到的改进幅度相当甚至更好。

系统这次找到的核心技巧包括:

FP8 精度的注意力计算。社区方案只在模型的最后一层(语言模型头)使用 FP8(8 位浮点)计算,而系统将 FP8 延伸进了注意力层的矩阵运算,前向传播用 FP8 以获得两倍的 Tensor Core 吞吐量,反向传播保留 BF16 以维持稳定性。

优化器中的退火探索噪声。系统在 NorMuon 优化器的更新步骤中注入了零均值高斯噪声,噪声幅度随训练进度线性退火至零。这有点像给优化器一个「先大胆探索、再稳健收敛」的行为模式,帮助最终解落在一个更平坦的损失盆地中。

更精简的融合 MLP 内核。 系统重写了一个 Triton GPU 内核,让前向传播只存储 ReLU 平方后的激活值,反向传播时在内核内部重算未平方的中间结果,省去了一次完整的激活张量在高带宽显存中的读写往返——这是硬件层面的直接提速。

三个改进,分属精度策略、优化器设计、GPU 内核编程三个不同的专业领域。系统在两年社区优化的结果上又找到了空间,本身就说明了问题。

场景三:GPU 内核优化(SOL-ExecBench)

前两个场景都在模型训练层面上工作,第三个场景则深入到更底层:GPU 计算内核的优化

SOL-ExecBench 是英伟达推出的基准测试,包含 235 个内核编写任务,覆盖矩阵乘法、归约、归一化层、注意力组件、量化例程、融合块等多类真实工作负载。评分标准是 SOL 分数:0.5 对应基准 PyTorch 实现,1.0 对应硬件理论极限。此前的最佳公开成绩是 0.699。

Recursive 的系统在 235 个内核上整体运行,允许跨任务复用发现的优化模式(例如内存搬运策略、分块方式、规约技巧),最终得分提升到了 0.754,将距离硬件极限的差距缩小了 18%。

这个场景意义特殊,因为内核工程是极高度专业化的领域——能写出高效 Triton/CUDA 内核的工程师在全球也是凤毛麟角。而 Recursive 团队在博客中坦承,他们自己也不是内核领域的专家,「这些想法来自系统本身,而不是来自我们的专业背景。」

Recursive:用 AI 研究递归改进 AI

发布这项成果的公司 Recursive Superintelligence 成立于 2025 年底至 2026 年初,上个月刚刚结束隐身状态,创始成员除了前 Meta FAIR 研究科学家总监田渊栋之外,还包括:

Richard Socher,Recursive CEO,前 Salesforce 首席科学家

Alexey Dosovitskiy,前 Google DeepMind 研究科学家和 Vision Transformer 第一作者,谷歌学术引用量超过 16 万

Tim Rocktäschel,前 DeepMind Principal 科学家和 UCL 人工智能教授

Peter Norvig,谷歌前研究总监,与 Stuart Russell 合著了 AI 领域著名教科书《人工智能:一种现代方法》

Caiming Xiong,前 Salesforce AI 副总裁

Tim Shi,前 OpenAI 研究员,企业 AI 公司 Cresta 联合创始人兼 CTO

Josh Tobin,Recursive CTO,前 OpenAI 与 Uber ATG 研究负责人

Jeff Clune,前 Google DeepMind 研究副总裁,加拿大不列颠哥伦比亚大学计算机科学教授

并且该创业公司一亮相,甚至还没有一个公开产品,就已手握 6.5 亿美元融资,估值高达 46.5 亿美元,由 GV(谷歌风投)和 Greycroft 领投,英伟达和 AMD Ventures 跟投。

公司的核心主张与名字直接对应:构建能够递归地提升自身研究能力的 AI 系统,让 AI 参与并加速 AI 本身的研发过程,最终形成持续自我增强的闭环。

更多详情,参阅报道《离开 Meta 后,田渊栋刚刚官宣创业了》。

当然,在赛道层面,Recursive 并不孤单。Yann LeCun 的 AMI Labs 在今年 3 月完成 10 亿美元融资,David Silver 的 Ineffable Intelligence 在 4 月拿下 11 亿美元种子轮,都指向相似的方向:让 AI 系统自主生成知识,减少人类在研究流程中的介入。但在公开成果的节奏上,Recursive 的这份「第一步」应该是目前同类公司中最具体、最可复现的技术展示之一。

递归范式的黎明

Recursive 发布的这份成果,放在更宏观的行业背景下,代表着一种新型 AI 研发范式的初步落地:让 AI 系统本身承担研究的主体角色

这种「递归式 AI」的核心逻辑并不复杂:AI 提升 AI 研究能力,改进后的 AI 又能更有效地提升自身,周而复始。它不依赖某个单一突破,而是依赖一个持续生成突破的系统。

这种思路对 AI 研究本身的经济学具有重要意义。前沿模型的训练流程仍然高度依赖少数具备特定技能的研究员,而能胜任这项工作的人全球不超过几千个。如果自动化研究系统能接管其中哪怕一部分工作,AI 进步的速度与成本曲线都会发生变化。

这一判断也与行业最近发出的其他声音形成了呼应。比如本文开头提到的 Anthropic 的《When AI Builds Itself》,语气并不轻松——它呼吁行业协调,在递归自我改进时刻到来时拥有暂缓乃至临时叫停前沿 AI 开发的选项,以留出时间让社会结构和对齐研究跟上节奏。更多详情请参阅《AI 自进化过快,Anthropic 呼吁全球中止研发》。

https://www.anthropic.com/institute/recursive-self-improvement

两件事同时发生,耐人寻味。一边是 Anthropic 在记录和警示这条轨迹的走向,另一边是 Recursive 这样的团队,正在一步一步地让这条轨迹变成现实。

当然,Recursive 自己也承认,这仍是「第一步」:当前系统在指标明确、反馈快速、作弊可检测的场景下效果最好,距离自主推进开放性科学问题还有相当距离。奖励作弊的防控将是规模化路上持续面对的核心挑战。

但一个闭环已经开始运转。接下来的问题,只是它会转得多快。

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:递归进化中的机器之心,编辑:Panda

热门币种推荐

相关问答

QAnthropic在《When AI Builds Itself》文章中提到的关键趋势是什么?

AAnthropic揭示了AI系统正朝着“递归自我改进”方向发展,即AI能够自主设计、构建和训练自身的后续版本,人类不再驱动每一步。截至2026年5月,其代码库中超过80%的代码已由Claude撰写,工程师代码合并量是2024年的8倍。该公司还呼吁行业在递归自我改进时刻到来时,需具备暂缓或叫停前沿AI研发的协调能力。

QRecursive Superintelligence发布的第一项公开技术成果是什么?它在哪些方面取得了突破?

ARecursive Superintelligence发布的第一项公开技术成果名为“First Steps Toward Automated AI Research”(迈向自动化AI研究的第一步)。这是一个开放式的自动化知识发现系统,成功在三个基准测试中取得了SOTA结果:1. 在固定计算预算的小模型训练中,将验证BPB从0.9372降至0.9109;2. 在NanoGPT Speedrun训练速度竞赛中,将训练时间从79.7秒压缩至77.5秒;3. 在GPU内核优化基准SOL-ExecBench中,将得分从0.699提升至0.754。

QRecursive的系统如何实现自动化AI研究?它与传统研究流程有何不同?

ARecursive的系统旨在将传统的“提想法—写代码—跑实验—分析结果—再提想法”的AI研究闭环自动化。其工作方式是:针对明确的优化目标,系统自动提出实验想法、实现代码、运行验证、从中学习并决定后续搜索方向。多条研究线路可并行推进,有效发现可跨任务复用,并内置奖励作弊检测机制以防止系统刷指标。这与高度依赖人类研究员介入、效率受限于人力的传统研究流程形成对比。

QRecursive Superintelligence的创始团队及融资情况如何?

ARecursive Superintelligence由田渊栋(前Meta FAIR研究科学家总监)联合创立,核心团队包括Richard Socher(CEO)、Alexey Dosovitskiy(Vision Transformer第一作者)、Tim Rocktäschel、Peter Norvig、Caiming Xiong、Tim Shi、Josh Tobin(CTO)和Jeff Clune等AI领域的资深专家。公司在亮相时已获得6.5亿美元融资,估值达46.5亿美元,由GV和Greycroft领投,英伟达和AMD Ventures跟投。

Q文章提到的“递归范式”对AI行业意味着什么?当前面临哪些挑战?

A“递归范式”意味着AI系统本身成为研究的主体,能够通过自我改进持续生成突破,从而改变AI进步的速度与成本曲线。这对AI研究的经济学有重要意义,可能缓解对稀缺人类研究员的依赖。然而,该范式仍面临挑战:当前系统在指标明确、反馈快速、作弊可检测的场景下效果最佳,但距离自主推进开放性科学问题尚有距离。奖励作弊的防控是规模化过程中的核心挑战,且其加速发展也引发了如Anthropic所警示的、需要社会协调与对齐研究跟上的伦理与安全考量。

你可能也喜欢

Chainlink CCIP 加入央行数字货币试点项目

Chainlink的跨链互操作性协议CCIP正被用于多个央行的数字货币及资产代币化结算试点项目,标志着该协议进入了区块链基础设施领域重要的机构性实验场景。这些试点包括巴西的Drex数字雷亚尔计划、中国香港的Ensemble代币化沙盒网络,以及香港金融管理局的e-HKD+项目(涉及澳新银行的A$DC)。目前这些均为试验阶段,尚未投入商业生产,但具有重要意义,因为它们展示了受监管机构如何测试公共区块链基础设施概念。 央行的试点项目虽然多数不会立即转化为完整生产系统,但揭示了机构正在探索的方向,尤其是互操作性这一核心主题。未来金融体系很可能由多个受监管的网络、支付系统和结算层构成,因此安全可靠的跨链通信与价值传输成为关键基础设施需求。CCIP在这些试点中扮演了跨链消息传递和结算层的角色,用于测试支付对支付结算、跨境资产流动等场景。 对Chainlink而言,参与这些试点有助于强化其机构市场定位,表明其技术正在对可靠性、风险控制要求极高的环境中接受检验。然而,试点不等于正式采用,要实现持续的商业化采用仍需克服监管审批、技术整合和机构协调等多重挑战。整体来看,这反映了资产代币化结算正成为一个重要的机构议题,行业焦点已从简单的资产发行转向互操作性、跨境结算和可编程金融基础设施。

bitcoinist31分钟前

Chainlink CCIP 加入央行数字货币试点项目

bitcoinist31分钟前

XRP账本修订案临近验证节点投票截止日期

XRP Ledger(XRPL)即将进入一项关键验证者投票窗口期,决定是否激活拟议的协议修正案。这凸显了XRPL升级并非仅由开发代码发布驱动,而需经过网络治理流程。 修正案通过rippled发布流程和验证者投票系统推进。与其他XRPL变更类似,拟议修正案需要获得广泛验证者支持才能激活,通常要求达到并维持80%的验证者同意门槛持续一段时间。这一设计旨在确保升级审慎,避免仓促变更,让参与方有充分时间评估新功能。 验证者在XRPL治理中扮演核心角色,其投票决定直接影响协议是否引入新功能,进而塑造未来在支付、资产发行和去中心化交易所等方面的效用。虽然市场注意力常集中于价格波动,但此类协议升级对网络的长期发展更为关键,可能影响智能合约功能、资产特性、交易类型及运行可靠性。 需要明确的是,投票截止日期并不意味着升级必然激活。即使功能已包含在代码版本中,仍需获得足够且持续的支持。验证者可能支持、保留支持或要求更多审查,这是一个健康的决策过程。 对XRP而言,修正案进程之所以重要,是因为其长期价值与XRPL的实用性能紧密相连。协议的进步若能带来更多用例、更好的工具和更强的应用需求,才能真正提升网络效用。因此,当前进展更应被视为基础设施的推进,而非单纯的市场价格信号。 总之,XRPL正进入又一个治理检查点,本次投票将反映验证者对推动下一组协议变更的态度。

bitcoinist45分钟前

XRP账本修订案临近验证节点投票截止日期

bitcoinist45分钟前

Solana稳定币市值突破150亿美元,网络流动性不断深化

Solana稳定币总市值突破150亿美元,显示出该网络流动性进一步深化。这一里程碑数据来自DeFiLlama,表明Solana生态中的稳定币活动日益活跃,为交易、支付、去中心化金融(DeFi)和链上结算提供了更坚实的基础。 稳定币是链上金融的“营运资本”,用于交易出入场、协议借贷、流动性池和支付结算,其增长比单纯的投机活动更能体现网络的真实效用和流动性提升。Solana凭借低费用和快速确认的优势,吸引了大量美元流动性。 目前,USDC和USDT仍是主导,但Solana的稳定币生态正趋于多样化。这有助于DeFi协议、支付应用和机构产品的集成,但也带来了复杂性,用户需关注资产的流动性、可赎回性和风险。 稳定币的增长直接利好Solana DeFi和支付领域:借贷市场可深化,去中心化交易所的大额交易滑点更低,支付应用能结算更多价值。这强化了Solana将高性能与日益增长的流动性及用户友好应用相结合的核心叙事。 关键点在于,市场将关注这些稳定币是否被活跃使用,而不仅仅是供应量。Solana的挑战在于通过构建有吸引力的应用,将流动性沉淀下来。跨越150亿美元大关是一个重要信号,表明Solana正在构建支撑更大规模金融活动的基础,其发展叙事正逐渐脱离纯粹的炒作周期。

bitcoinist1小时前

Solana稳定币市值突破150亿美元,网络流动性不断深化

bitcoinist1小时前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

345人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.2k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片