机器人GPT-3时刻震动硅谷,0行代码,看一遍秒会,黄仁勋李飞飞参投

marsbit發佈於 2026-08-21更新於 2026-08-21

文章摘要

硅谷机器人公司Generalist AI发布新一代基础模型GEN-1.5,被多位研究者类比为“具身智能的GPT-3时刻”。该模型展现出了强大的上下文学习能力:仅需给机器人观看一段3到12秒的动作演示,无需额外训练或编写代码,即可当场执行任务,在10个操作任务上平均成功率达59%。若提供约5分钟演示数据进行少量微调,成功率可提升至83%。 GEN-1.5的关键突破在于其“即兴发挥”的泛化能力。例如,模型能将演示中“用刷子扫积木”的策略,在工具被替换为簸箕后,自主转换为“铲起来倒”的全新动作序列。这种能力源于大规模物理交互数据的预训练,并显示出类似大语言模型的“缩放定律”迹象——随着数据规模和训练时间的增长,模型能力持续增强,适配新任务的边际成本趋近于零。 该模型的发布正值机器人领域密集活动期,包括宇树科技上市、世界机器人大会召开等,引发了行业高度关注。业内认为,这标志着竞争重心可能从硬件制造转向对物理交互数据和通用“大脑”模型的争夺。尽管当前演示任务仍相对简单,但其所揭示的技术方向被认为极具潜力,可能深刻改变机器人编程、部署乃至整个产业的发展路径。

8 月 19 日,宇树科技在科创板敲钟上市,开盘报 1100 元/股,市值约 4449 亿元。

同一天,英伟达 CEO 黄仁勋的女儿黄敏珊飞抵北京逛 WRC 世界机器人大会。

而就在第二天北京时间凌晨,硅谷机器人公司 Generalist AI 发布了新一代基础模型 GEN-1.5。

两个月前,斯坦福教授李飞飞刚以个人身份投了 Generalist AI 的 4 亿美元融资,同轮天使投资人还有小米联合创始人林斌和 Zoom 创始人袁征。英伟达也是股东。聪明钱和聪明人同时涌向同一个方向。

GEN-1.5 给出了它们投资的理由:给机器人看一段 3 到 12 秒的动作演示,不训练、不微调,当场执行,10 个操作任务平均成功率 59%。

以前教一个机器人拧瓶盖,工程师要编程三个月。现在需要的全部投入是一段三秒钟的演示,和零行代码。

多位顶尖研究者将这一刻类比为 2020 年 GPT-3 的发布,认为具身智能走到了自己的 GPT-3 时刻。

没人教过的策略从预训练中涌现

GEN-1.5 最让研究者震动的能力不是模仿,关键在于即兴发挥。

Generalist AI 做了一个实验:用 5 分钟的人类演示数据(只做了 1 个梯度步骤的微调),教机器人用刷子把积木扫进碗里,然后替换工具。

给它一根香蕉,它把香蕉当成刷子,横扫积木入碗——这不奇怪,香蕉的形状和接触策略与刷子类似。

给它一个簸箕,它放弃了「扫」的策略,用另一只手把积木推上簸箕,抬起簸箕,把积木倒进碗里。

「扫」和「铲起来倒」是两种完全不同的接触序列,训练数据里没有教过这套动作。

Generalist AI 用最近邻语言搜索在约 189 万段预训练场景中检索,没有找到类似的簸箕用法。

没有人在任何阶段告诉模型应该这样做。

类似的即兴行为在测试中反复出现:碗被一张纸盖住了,模型自己掀开纸再放积木,有时还会把纸盖回去,但训练数据里没有这个场景。

一块乐高积木粘在机械手指尖上,模型用另一只手把它拨下来。

训练数据只演示了用一只手旋转罐盖,模型在某些尝试中自发切换到双手操作,采用了完全不同的抓取和旋转策略。

一个只被训练放一块积木进一个碗的模型,开始自发按颜色分拣多块积木。

这些能力有一个共同来源:大规模预训练。

GEN-1.5 已经连续预训练超过 8 个月,经历了三个训练阶段。

Generalist AI 公布的验证集曲线显示,模型的「下一步动作预测误差」持续下降,至今没有出现收敛的迹象。

用大语言模型领域的术语说,这就是具身智能的 Scaling Law(缩放定律):随着物理交互数据的规模增大和训练时间的延长,模型的泛化能力在持续增强。

一个反直觉的发现让这条线索更加清晰:微调的梯度步骤越少,即兴发挥能力越强。

Generalist AI 的解释是,轻度微调让模型更接近预训练积累的广泛行为库,保留了更多可调用的「物理经验」。

10 个梯度步骤只改变了模型参数的 0.15%。

Generalist AI 的说法是:这已经接近于「提醒模型一些它几乎已经知道的事情」。

GEN-1.5 还跨越了两道长期困扰机器人领域的鸿沟。

在模拟器里录制一段演示(尽管预训练数据中不包含任何仿真数据),塞进上下文窗口,真实机器人直接执行任务,并且能泛化到不同的机械手和新的物体位置。

在部分测试中,一个人直接用自己的双手在机器人摄像头前演示动作,机器人随后用机械手复现了任务。

Generalist AI 表示,所有这些能力都不是刻意设计的结果:没有专门促进上下文学习的架构改动,没有元学习循环,没有鼓励即兴发挥的辅助训练目标。

这些能力从大规模物理数据的预训练中自行出现。

「操作学习的圣杯」

其他研究团队此前也展示过类似的上下文学习能力,但仅限于少数任务类型,GEN-1.5 的新颖之处在于覆盖面;所有结果均为 Generalist AI 自行报告,尚未经过独立验证。

任务本身是简单的短程操作(拧瓶盖、拉拉链),距离真实场景中的长程复杂任务仍有很大距离。

GPT-3 发布于 2020 年 6 月,从 GPT-3 到 ChatGPT 过了两年半(是的,两年半)。

GEN-1.5 现在的位置与 2020 年的 GPT-3 类似:能力粗糙但方向明确,任务简单但 Scaling 趋势清晰。

Generalist AI 在官方博客中写了一段引人深思的话:

过了某个预训练阈值之后,适配一个新任务的成本变得可以忽略不计。

涌现的上下文学习、几秒钟的数据、或者一个梯度步骤加一分钟的演示,已经不再是传统意义上的任务特定训练,更接近于提醒模型一些它几乎已经知道的事情。

如果具身智能的 Scaling 曲线确实没有收敛的迹象(Generalist AI 说他们还没有看到),那么下一轮竞争的核心资源就变成了谁拥有足够多的物理交互数据来喂给这台引擎。

这和 2021 年大语言模型进入数据争夺战的剧本,如出一辙。

看一遍就能学会,59% 和 83% 两组数字背后的拐点

2020 年 6 月,OpenAI 发布 GPT-3。

这个模型做了一件当时没人做到的事:不需要重新训练,只要在对话框里给几个例子,它就能完成新的语言任务——给一组「红→苹果,黄→香蕉」的例子,再问「绿→?」,它能答出「西瓜」。

这种能力叫 in-context learning(上下文学习),是大语言模型从「专用工具」变成「通用平台」的分水岭。

GEN-1.5 把同样的事搬进了物理世界。

Generalist AI 称之为 Physical Prompting(物理提示)。

操作方法很直接:一段真实的动作演示(包含传感器数据和动作轨迹)塞进模型的 30 秒上下文记忆窗口,剩余空间用来接收实时环境观测。

模型立刻尝试执行,整个过程没有任何训练步骤。

这里需要解释一个对理解 GEN-1.5 至关重要的概念:梯度步骤(gradient step)。

传统做法中,教机器人学新任务需要数万步梯度下降,每一步都是对模型内部参数的一次微调——这个过程通常需要大量数据和大量算力。

GEN-1.5 的 one-shot 模式(只演示一次的模式)跳过了全部梯度步骤,模型参数纹丝不动。

Generalist AI 在 10 个不同的操作任务上测了 GEN-1.5 的表现:拧开玻璃罐盖、拉开笔袋拉链、从钱包里取钱、叠纸、叠杯子、翻手机、用刷子扫积木、打开书本封面、撕开真空垫、清扫垃圾。

结果分两组:

one-shot(看一遍,零梯度步骤):10 个任务平均成功率 59%(标准差 ±10%)。

few-shot(少样本,5 分钟数据、约 50 次演示、10 个梯度步骤):平均成功率 83%(标准差 ±9%)。

2020 年 GPT-3 在语言任务上的数字拿来对照:one-shot 约 45%,few-shot(约 100 个例子)约 65%。

两组数字的结构高度相似。

这组数字的含义可以这样理解:在大语言模型出现之前,让 AI 做一个新的语言任务(比如翻译一种没见过的格式),需要专门采集数据、训练一个新模型,周期以月计。

GPT-3 之后,这件事变成了「在输入框里写几个例子」,时间成本从数月压缩到数秒。

GEN-1.5 在物理操作领域做了同样的压缩。

以前教机器人拧瓶盖,需要工程师编程数月或者喂数万条训练数据反复调参。

现在,一段 3 到 12 秒的演示就够了。

Generalist AI 在官方博客中写道:这改变了两件事:机器人变有用的速度(从数月到数秒),以及谁能使用机器人(从专家到任何人)。

机器人沸腾的一周:宇树上市机器人大会与运动会同时开幕

GEN-1.5 发布的时间点,落在整个具身智能行业最密集的一周。

8 月 19 日开始,WRC 世界机器人大会在北京亦庄开幕,300 余家企业、超过 2000 件展品、150 余款全球首发新品集中亮相。

三天后的 8 月 22 日,第二届世界人形机器人运动会在国家速滑馆「冰丝带」开赛——666 支队伍携 2056 台机器人参加 51 个项目的 1301 场比赛,队伍数量比首届增长 138%。

运动会首次设置 21 个场景赛项,要求人形机器人在工厂、酒店、家庭服务等真实环境中完成长程任务,机器人「上岗实测」成为主题。

刚敲钟的宇树科技,2025 年人形机器人出货量超过 5500 台,全球第一,营收 17 亿元,毛利率 60%, DeepSeek 也参与了战略配售。

但宇树的招股书里藏着一组反差数据:2026 年一季度营收增速从上年同期的 332.64% 回落至 68.49%,扣非后净利润同比下降 52.55%。增速放缓的核心原因是研发投入大幅增加。

宇树在追赶的,正是它还没有的东西:具身智能大模型。

「新立场Pro」在一篇分析(《宇树科技的招股书里,藏着对工程奇迹“保质期”的焦虑》)中写过宇树面临的结构性困境:宇树造出了全球出货量第一的躯体,但「大脑缺席」。

2026 年被称为具身智能的「上市大年」,超过 20 家公司明确了上市计划,但驱动上市潮的很大程度上是资金压力。

大量竞争对手依赖一轮接一轮融资维持运转,研发节奏被融资窗口牵着走。

图源:晚点LatePost《具身智能的金钱游戏》

宇树创始人王兴兴在 WRC 上公开表示,限制人形机器人发展的主要瓶颈是具身智能大模型,「预计未来快则两到三年,慢则五到十年,有望实现机器人的 ChatGPT 时刻」。

GEN-1.5 的发布,可以视为对这个判断的第一个实证回应。

Scaling Law 在具身智能领域存在,大规模预训练能让新任务适配的边际成本趋近于零。

这个结论对宇树这类躯体厂商有直接的产业含义:一旦大脑层面的通用模型成熟,躯体的价值将取决于它能多快接入这颗大脑,而不仅仅是硬件参数和出货规模。

Generalist AI 的团队背景与这条技术路线高度一致。

联合创始人 Pete Florence 和 Andy Zeng 来自谷歌 DeepMind 机器人团队,Andrew Barry 来自波士顿动力。

从左至右分别为:Pete Florence, Andrew Barry, Andy Zeng

公司 2026 年 6 月完成 4 亿美元融资,Radical Ventures 领投,英伟达和 Bezos Expeditions 参投,投后估值 20 亿美元。

Generalist AI 正在以 30 亿美元估值洽谈新一轮融资。

硅谷大佬们,迎来久违的集体沸腾时刻

这次发布在机器人研究社区引发了强烈反应。

联合创始人 Pete Florence 在 X 上写道:

自从开始研究机器人基础模型以来,广泛的 one-shot 上下文学习一直是我心中最清晰的目标。

现在我看到了将近十年的想象走进现实世界。

Florence 提到,他和 Andy Zeng 在研究生阶段就讨论过一种「Ctrl-C-Ctrl-V」式的能力:看到一个动作,机器人就能复制——但实现它极其困难,因为「你想粘贴的那个世界,和你复制的那个世界永远不一样」。

卡内基梅隆大学机器人研究者 Chris Paxton 在 X 上称 GEN-1.5「可能是真正的 GPT 时刻」,并写道:

操作学习的圣杯,毫无疑问,就是 one-shot learning。

https://x.com/chris_j_paxton/status/2090270734816092334

https://x.com/chris_j_paxton/status/2090210797125611972

美国东北大学具身智能研究者 Jimmy Yang 转发时说:

作为具身 AI 研究者,这对这个领域来说是一个真正特别的时刻。

https://x.com/JimmyTYYang1/status/2090202923632366073

英伟达机器人技术总监 Jim Fan 的评论提供了一个深入的技术观察视角。

他指出 GEN-1.5 涌现能力的两个关键因素:

一是训练数据中自然存在的对称重复动作模式,比如组装家具时反复拧螺丝,第二颗螺丝就是第一颗的「上下文学习样本」;

二是数据中人类失误后的恢复动作,东西掉了捡起来继续,这种「失败-恢复-继续」的完整弧线让模型在测试时自然展现出纠错能力。

Jim Fan 还指出,Generalist AI 使用的 UMI 数据采集方式(人直接戴着机器人夹爪操作)保留了人类的「物理直觉」,传统遥操作中经过 VR 设备的中转会让这种直觉大量流失。

https://x.com/DrJimFan/status/2090465981240086992

当然,理性的冷水也同样存在。

Jim Fan 在同一条推文的评论区里写道:

演示目前仍然有点太简单了,还不能下结论。

https://x.com/DrJimFan/status/2090469108764823587

本文来自微信公众号“新智元”,作者:ASI启示录

相關問答

QGEN-1.5模型的主要突破性能力是什么?

AGEN-1.5的主要突破在于实现了物理世界的上下文学习,即“看一遍就会”的能力。通过给机器人看一段3到12秒的动作演示视频,无需任何代码或专门训练,机器人就能当场模仿并执行相似任务,在10个操作任务上平均成功率达59%。此外,它还能涌现出即兴发挥的能力,例如在面对新工具或意外情况时,能自行调整策略完成任务。

Q文章中提到的“具身智能的Scaling Law”具体指什么?

A文章中的“具身智能的Scaling Law”指的是,随着机器人模型预训练所用物理交互数据规模的增大和训练时间的延长,其任务泛化能力持续增强的现象。GEN-1.5经过超过8个月的大规模预训练后,其“下一步动作预测误差”持续下降且未出现收敛迹象,这表明在该领域也存在类似大语言模型的“缩放定律”——数据越多,模型能力越强。

QGEN-1.5的成功对宇树科技这类机器人硬件公司意味着什么?

AGEN-1.5的突破对宇树科技这类以硬件制造为主的公司意味着结构性挑战。文章指出,宇树虽然造出了全球出货量第一的机器人“躯体”,但缺乏“大脑”(即具身智能大模型)。一旦像GEN-1.5这样的通用智能模型成熟,机器人硬件的核心价值将快速转变为谁能更快、更好地接入这颗“大脑”,而不仅仅是硬件参数和出货规模,这加剧了硬件厂商在智能算法层面的竞争压力。

Q开发GEN-1.5的Generalist AI公司,其团队和融资背景如何?

AGeneralist AI的团队背景深厚,联合创始人Pete Florence和Andy Zeng来自谷歌DeepMind机器人团队,Andrew Barry来自波士顿动力。公司在2026年6月完成了4亿美元的融资,由Radical Ventures领投,英伟达和贝索斯旗下的Bezos Expeditions参投,投后估值达20亿美元。知名投资者如李飞飞(个人身份)、黄仁勋(英伟达)、小米林斌和Zoom袁征也参与了投资。目前公司正以30亿美元估值洽谈新一轮融资。

Q业界专家对GEN-1.5的发布有何主要评价和保留意见?

A业界专家对GEN-1.5的评价非常积极,认为这标志着“具身智能的GPT-3时刻”到来,是“操作学习的圣杯”。卡内基梅隆大学的研究者称其可能是“真正的GPT时刻”。英伟达的Jim Fan分析了其能力涌现的关键数据因素。但同时,也有理性的冷水,例如Jim Fan也指出,目前的演示任务仍然相对简单(如拧瓶盖、拉拉链),距离真实世界的长程复杂任务仍有很大距离,因此还不能过早下定论,其能力仍需在更复杂场景中得到独立验证。

你可能也喜歡

Bitcoin.com钱包新增对TRON的原生支持,为百万用户带来TRX和USDT-TRC20

2026年8月21日,阿联酋迪拜——全球广泛使用的加密货币平台Bitcoin.com宣布,其自托管钱包应用Bitcoin.com Wallet现已原生支持TRON网络。用户可直接在应用内持有、发送、兑换和购买TRX及TRON上的USDT(USDT-TRC20)。 TRON网络已成为USDT结算最广泛使用的网络之一,USDT-TRC20在众多主流交易所和支付服务中被普遍接受,是交易所间转账和新兴市场美元计价支付的常用选择。通过此次原生集成,Bitcoin.com Wallet用户可直接向需要TRC20地址的对方进行交易,无需离开钱包或安装新应用。 Bitcoin.com CEO Corbin Fraser表示,此次更新填补了用户对“TRON网络USDT”支付需求的空白。 用户现可在钱包中: 1. 将TRX和USDT-TRC20加入现有资产组合。 2. 向任何TRON地址发送和接收TRX及TRC20代币。 3. 在应用内兑换TRX、支持的TRC20代币及其他资产。 4. 直接通过卡或银行转账购买TRX和USDT-TRC20。 TRON创始人孙宇晨指出,TRON网络承载着超过900亿美元的USDT流通量和230亿美元的日转账量,是稳定币支付的主导网络。Bitcoin.com Wallet的集成使稳定币支付更快捷、简单和易用。 该功能现已上线iOS、Android和网页版,用户无需跨链桥接、管理独立钱包或离开应用即可使用TRON网络。Bitcoin.com Wallet是一款非托管、多链钱包,致力于通过提供便捷的加密货币访问促进全球自由与繁荣。TRON DAO则致力于通过区块链技术和去中心化应用加速互联网的去中心化进程。

cointelegraph22 分鐘前

Bitcoin.com钱包新增对TRON的原生支持,为百万用户带来TRX和USDT-TRC20

cointelegraph22 分鐘前

Flowra为Solana区块构建推出开放订单流拍卖

Solana生态系统正经历重大基础设施变革。区块链基础设施公司Flowra推出了一项名为“开放订单流拍卖”的新型区块构建系统,旨在增强交易排序环节的竞争性,并让验证者能获取更多由MEV产生的价值。 目前,Solana的交易排序和MEV市场高度集中,许多验证者传统上依赖封闭的订单流渠道。Flowra的开放拍卖系统允许注册的搜索者通过公开竞价竞争交易打包权,而非依赖私人渠道。该公司表示,此举可改善价格发现,同时为验证者创造更多通过区块空间需求盈利的机会。 初步测试显示积极结果:在一位验证者上,采用Flowra的系统使每区块计算单元增加了20.6%,使其从网络平均水平的84%提升至101%。测试期间还实现了更高的区块费用、完整的区块生产以及99.999%的区块引擎运行时间。 此外,Flowra推出了“可编程区块策略”,赋予验证者更多控制区块内交易的能力,以满足特定监管或机构要求,而无需修改Solana协议。公司还与合规基础设施提供商Honeypot合作,为该区块构建层引入制裁与风险筛查。 Flowra的灵感来源于以太坊的竞争性区块构建市场,其认为Solana的高吞吐量和低延迟同样适合此类开放竞价模式。目前该系统已面向Solana生态内的验证者和搜索者开放,并正招募机构级验证者参与,预计随着参与度提升将进行更广泛的推广。

TheNewsCrypto41 分鐘前

Flowra为Solana区块构建推出开放订单流拍卖

TheNewsCrypto41 分鐘前

半导体现新一轮涨价潮,意法半导体、卓胜微等密集调价

半导体行业正迎来新一轮由供需与成本共同驱动的涨价潮。8月以来,意法半导体、亚德诺(ADI)、卓胜微等国内外多家企业密集发布调价通知,模拟芯片、射频芯片等领域成为价格调整的集中爆发点。 意法半导体宣布自8月23日起执行年内第三次涨价,覆盖多条产品线,原因在于多个行业需求持续增长给全球供应链带来压力,导致运输、能源、原材料及制造成本大幅上升。亚德诺也跟进调价,全产品组合价格将于9月13日上调,这是其本年度第二轮涨价,主要受全方位需求增长和供应链通胀压力驱动。 国内射频芯片龙头卓胜微于8月10日通知,自9月1日起全系列RF射频产品涨价,原因是上游原材料价格持续走高,晶圆代工与封测产能紧张,以及AI算力需求爆发加剧了成本攀升。此外,国民技术也表示将于10月1日起对部分高性能MCU产品提价10%-20%,主因国际友商交期拉长导致国产替代需求增加,以及AI需求挤占了上游产能。 相比上半年由存储芯片领涨的行情,本轮涨价重心转移至成熟制程赛道。AI算力不仅消耗先进制程,也大量占用8英寸成熟产能,挤压了射频、工业模拟、车规MCU等产品的供给,直接推高制造成本。分析指出,模拟与功率半导体扩产周期长,短期产能难以匹配需求,价格韧性较强,但下游企业的成本承受能力存在天花板,可能通过替换料号等方式对冲压力,从而约束后续提价空间。 总体来看,短期内模拟、射频、功率芯片价格松动概率较低,但下游成本耐受度及全球宏观需求波动将成为影响未来价格走向的关键变量。

marsbit1 小時前

半导体现新一轮涨价潮,意法半导体、卓胜微等密集调价

marsbit1 小時前

交易

現貨
活动图片