硅谷今日最热具身模型,不用后训练,看一遍就学会

marsbit发布于2026-08-26更新于2026-08-26

文章摘要

近日,硅谷具身智能领域迎来新突破。初创公司Skild AI发布了机器人基础模型S1,其核心创新在于强大的上下文学习能力:机器人无需针对新任务进行后训练或微调,仅观看一段约10分钟的人类示范视频,就能直接模仿完成一系列复杂的长程操作,如煎饼、冲泡咖啡、植物换盆等。 实验显示,S1在处理训练数据中未见过的任务时,成功率高达66%,远超基于语言提示的VLA方法。传统方法需要约380次演示训练才能达到相近水平。Skild认为,这标志着机器人学习正从需要大量任务特定数据微调的“BERT时代”,迈向仅通过示例就能快速学习的“GPT时代”。 S1的推出意味着开发机器人新技能的成本可能大幅降低,从“反复训练数百次”变为“看一遍就会”。Skild AI由CMU的两位知名教授创立,致力于打造跨机器人平台的通用“大脑”,其估值在两年内飙升近十倍。如果这种上下文学习的扩展定律持续有效,机器人的“GPT时刻”或许正在成为现实。

具身智能的大结果,要来了!!!

自上周Generalist发布能够学习3到12秒动作的具身大脑Gen 1.5 以来~

刚刚,北美具身初创Skild AI又发布了全新机器人基础模型S1,直接把机器人上下文学习的任务长度拉到了10分钟往上

这次的S1主打上下文学习(in-context learning,ICL):

无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能“照猫画虎”,直接完成一整套从未见过的复杂操作流程。

在官方演示里,机器人完成了煎饼、冲泡咖啡、给植物换盆,以及设备组装等长程任务。并且在未见过的任务上,把成功率干到了66%,远超基于语言提示的VLA(只有 9%)。

另外,哪怕是走传统后训练微调的路线,想追平S1只看一次演示的效果,大概也要喂进去380次左右的任务演示。

非常amazing!

可以说,最近这一波集中在上下文学习的工作,又给不少人重新燃起了对具身的希望。

有推特网友表示,通用机器人可能两年后就会出现,而不是七年。

还有网友表示,从Rhoda,到上周Generalist,再到现在Skild S1的10分钟任务,机器人真正的GPT时刻似乎正在出现。

因为一旦这种能力真的泛化,以后开发机器人技能,可能真的会变得像给ChatGPT 写 Prompt一样。

真有这么神吗?我们一起来看。

从BERT时代,迈向GPT时代

想要理解S1这次到底怎么个上下文学习,咱们得先看看,传统机器人是怎么学习一个新技能的。

在传统的pipeline里,机器人学习其实和大模型差不多:

先在海量数据上进行预训练,学会一些基础能力;然后到了具体场景,再针对某个任务收集数据,通过后训练,让机器人学会专有技能。

只不过问题在于,机器人和大模型虽然流程差不多,但数据成本却完全不是一回事。

大模型的预训练数据,大量来自互联网;哪怕到了编程、Agent这些专门场景,很多后训练数据也可以在线上快速获得,甚至自动生成。

但机器人就比较惨了。预训练数据得在现实世界里采,后训练数据还是得在现实世界里采。

所以,在技术博客中,Skild AI就直接开麦了:

如果一个机器人基础模型,每学一个新任务仍然需要几十、几百小时真机数据,再重新后训练,那我请问,这个“基础模型”,基础在哪儿?

他们甚至引用已有研究指出,如果针对一个新任务的数据已经足够多,那么从零训练的模型甚至都可能追平经过预训练再微调的基础模型。

所以,具身预训练的意义到底是啥?

对此,Skild给出的答案是:上下文学习

为了有一个参考坐标,Skild拉来了大模型的发展路线作为对照。

早期的BERT已经很强了,但每碰到一个新任务,往往还是得重新准备数据,再微调一遍。

真正改变游戏规则的,是后来GPT-3之后逐渐显现出来的上下文学习能力:

不用改模型权重,只要在Prompt里给几个例子,模型就能临时“学会”一个新任务。

基于此,Skild认为,机器人现在其实还困在类似的BERT时代,他们真正想要的是,是让机器人也完成同样一次范式转换。

也就是说,预训练真正的价值,不应该只是让后训练少采一点数据,而是让机器人最终获得“从上下文里直接学习”的能力。

上下文学习

那么,S1这次到底从上下文里学到了什么?

Skild认为,真正能检验机器人上下文学习能力的,其实就两个维度:

一个是,能不能学会训练时根本没见过的新技能;另一个是,能不能把已有技能重新组合起来,完成一个很长、很复杂的新任务。

比如,机器人只需观看一段翻煎饼的视频,就能学会如何制作煎饼——

即便这项技能此前从未出现在它的训练数据中。

与此同时,相较于上周Gen-1.5展示的秒级视频,S1这次直接把上下文学习拉到了最长10分钟

在植物换盆等任务中,每个任务都需要连续完成几十个操作步骤。在这些长程任务的演示中,机器人不仅需要做到照猫画虎,还需要知道:

我现在做到哪一步了,下一步该干嘛,技能之间怎么组合,中间搞砸了又该怎么继续。

也就是说,机器人需要真正理解视频演示里任务-动作的意图,见招拆招、随机应变,而不仅仅是行为克隆那么简单。

此外,在植物换盆任务中,从开始录演示,到机器人自己上手,只花了11分钟,直接在效率这一块,给传统后训练秒了。

最后,在整个过程中,S1没有用fine-tuning,也没上post-training,模型权重完全不变,用同一套权重,就完成了博客里展示的所有任务。

基本对齐了大模型从Bert需要特定场景微调,到GPT-3只看演示就能完成OOD任务的跨越。

唯一的不同就是,用的prompt不再是语言,而是用了能够更好对齐下游任务的动作视频。

实验:ICL到底是不是更能scale?

在实验部分,Skild先在(训练数据)见过的任务和未见过的任务上,对比了ICL视频Prompt和传统的语言Prompt VLA。

测试结果表明,当训练数据只有1000小时时,语言Prompt效果更好,而随着数据规模增加,ICL开始反超。

到了10万小时,训练时见过的任务上:ICL 96%,语言Prompt 89%。

而在真正关键的OOD任务上:ICL 66%,语言Prompt只有9%,直接拉开了7倍以上的差距。

为了验证S1的泛化性,Skild又在不同的实验条件下进行测试。

结果表明,语言Prompt VLA的性能下降幅度,最高达到ICL的3倍。

也就是说,ICL学到的不是固定场景里的动作复读,而是更能跟着当前环境重新规划怎么做。

最后,在One shot learning方面。

S1在新任务上完全不做post-training,只看一条视频演示,成功率就达到66%。

相较之下,传统VLA则大概要经过约380次演示的后训练,才能追到同样水平。

当然,继续堆到2000次演示后,传统post-training最终能做到86%。

所以结论可能不是“以后机器人不用训练了”,而是:

以前一个新技能可能得教几百遍,现在先看一遍,就能直接做到六七十分。

这也是Skild所谓的ICL scaling law:

数据越多,模型不只是会更多技能,而是越来越会“从演示里学技能”。

Skild AI是谁?

Skild成立于2023年,背后站着两个CMU机器人圈的老熟人:Deepak Pathak和Abhinav Gupta。

两人都是卡内基梅隆大学机器人研究所的教授,Deepak主要研究机器人学习、强化学习和计算机视觉,Abhinav则是计算机视觉、自监督学习领域的大神。

早在2022年,两人就合作过WHIRL,让机器人通过观看人类视频进行one-shot imitation,可以说S1这条路线,也不是突然从石头缝里蹦出来的。

作为北美具身圈的明星企业,2024年Skild刚走出隐身模式,就拿下3亿美元A轮、估值15亿美元;

到了今年1月,又完成14亿美元C轮融资,估值直接干到了140亿美元以上,SoftBank领投,英伟达、贝索斯等继续上桌。两年多时间,估值接近翻了10倍。

横向对比来看,Skild在北美具身圈的定位也相当特殊。

相比于PI更像是在搞“机器人GPT”,Generalist最近强调的是one-shot learner,以及Genesis AI、Sunday最近的全栈势头,Skild一直强调的是一句话:Any robot,any task, one brain

它更强调跨embodiment,希望同一个Skild Brain能够跑在机械臂、四足、人形等不同身体上。

说的通俗一点,就是想成为机器人时代的安卓:一个智能层,塞进各种不同的身体里。

这也由此决定了Skild的数据策略:全都要

Skild把机器人数据看成hardware proximity、diversity和scalability三个维度:

真机遥操最接近硬件,但贵;第一视角人类视频最容易规模化,但和机器人身体差得远;仿真便宜能猛造,却又有sim-to-real gap。

所以他们对于Robot Teleop、UMI、Egocentric Video、Simulation,基本上采取的就是都用的策略。

而S1的ICL,其实也是这条路线自然延伸:

2025年9月LocoFormer → 2026年2月首次In-Domain ICL → 5月第一次翻煎饼 → 8月S1发布,直接把上下文学习推到最长10分钟的OOD长程任务。

所以现在真正值得关注的问题,可能已经不是机器人还能不能学会更多技能,而是:

机器人学习一个新技能的成本,能不能真的从“教几百遍”,变成“你做一遍,它看一遍”。

如果这个scaling law还能继续成立,那所谓机器人的GPT moment,可能真的不只是又一个营销梗了。

参考链接:[1]https://www.skild.ai/blogs/s1

本文来自微信公众号“量子位”,作者:henry

相关问答

QSkild AI 发布的全新机器人基础模型 S1 主打什么核心能力?

AS1 主打上下文学习能力,无需在后训练阶段专门学习新的操作数据,只需看一段人类示范视频,就能直接模仿完成一整套从未见过的复杂、长程操作任务,任务长度可达10分钟以上。

Q根据文章,在未见过的任务上,S1 的上下文学习成功率相比基于语言提示的VLA有何优势?

A在未见过的任务上,S1 的上下文学习成功率达到了66%,而基于语言提示的VLA成功率只有9%,S1远超VLA。

QSkild AI 将机器人S1的上下文学习能力,类比为大模型发展史上的哪次重要范式转换?

ASkild AI 将S1的上下文学习能力,类比为从BERT时代(需要为每个新任务微调)迈向GPT时代(通过上下文提示即可学习新任务)的范式转换。

QS1 模型实现上下文学习时,其模型权重有何特点?

AS1 在通过观看演示视频学习并执行新任务的过程中,没有进行微调或后训练,模型权重完全保持不变,使用同一套权重就完成了所有演示任务。

QSkild AI 对于机器人数据的收集策略是什么?他们如何解决不同数据来源的优劣?

ASkild AI 采取“全都要”的数据策略,综合利用机器人遥操数据、第一视角人类视频、仿真数据等多种来源,以平衡数据的硬件接近性、多样性和可扩展性。

你可能也喜欢

伊朗里亚尔跌至历史新低,新制裁瞄准其“救命稻草”——比特币挖矿

本周,伊朗里亚尔汇率跌至历史新低,公开市场上约202万里亚尔兑1美元,而今年第一季度为153万。此次暴跌恰逢特朗普政府启动“经济流放者”行动,于8月19日宣布大规模制裁,将60多家机构列入财政部的黑名单。值得注意的是,制裁首次将数字资产列为目标领域,与黄金、航空等技术并列。 美国财政部长斯科特·贝森特表示,目标是迫使伊朗国家银行“关闭停业”或完全失去美元通道,并警告未来几周可能对伊朗贸易伙伴实施次级制裁。国际货币基金组织预测,伊朗2026年平均年通胀率将达68.9%,经济收缩5.4%。自压力升级以来,大米和牛肉价格已大幅上涨。 伊朗的加密货币生态已成为规避制裁的关键工具。德黑兰自2019年便合法化比特币挖矿,许可矿工以极低电价运作,并将开采的币出售给央行。据估计,伊朗革命卫队控制的矿场目前占据了该国约65%的算力,占全球比特币算力的3%至7%,累计开采价值高达13.5亿至31.5亿美元。2025年,伊朗整体加密货币生态价值达77.8亿美元,其中革命卫队相关钱包地址在第四季度就收到超30亿美元。另据分析,伊朗央行已积累至少5.07亿美元的USDT用于支撑里亚尔汇率。 数月来,美国已逐步采取行动破坏这一网络。6月,财政部外国资产控制办公室制裁了Nobitex、Wallex等伊朗主要加密交易所。仅Nobitex就处理了伊朗超一半的数字资产流入,并协助央行转移数亿美元稳定币。今年4月,美财政部还扣押了近5亿美元与伊朗相关的加密资产。2025年Nobitex遭遇超9000万美元的黑客攻击,加上Tether资金冻结及地缘政治风险上升,导致伊朗2025年加密货币流量实际降至37亿美元。 贝森特提出对继续与伊朗贸易的国家实施次级制裁,这将打击伊朗加密网络兑换现金所依赖的中间商。此外,伊朗挖矿作业本身也很脆弱:电网已承受压力,军事升级或停电导致的电力配给,可能比制裁清单更能有效迫使革命卫队关联矿场关闭。 简言之,里亚尔暴跌和新制裁只是长期博弈的最新篇章。伊朗的“加密生命线”屡遭压制,但迄今总能找到新的规避方式。

cryptonews.ru22分钟前

伊朗里亚尔跌至历史新低,新制裁瞄准其“救命稻草”——比特币挖矿

cryptonews.ru22分钟前

湖北国资,迎来史上最大回报

近日,长江存储控股股份有限公司(长存控股)科创板IPO获受理,拟募资330亿元,有望成为科创板史上最大IPO。长存控股与合肥长鑫科技并称“国产存储双子星”,长鑫科技上市后市值一度突破4万亿,为合肥国资带来巨额回报。如今,长存控股的上市将使湖北国资迎来价值兑现。 长存控股起源于2006年成立的武汉新芯,2016年由国家存储器基地项目推动组建。经过十年发展,公司已成长为全球NAND闪存市场的重要玩家。其股东中,湖北长晟、芯飞科技、光谷产投、国芯基金、长江产业集团等湖北国资体系持股比例合计较高。若公司上市后市值达到万亿级别,湖北国资将获得数千亿元的账面回报。 武汉近年硬科技企业崛起,除长存控股外,华工科技也在武汉国资长期支持下市值突破千亿。光谷已聚集1.6万家光电子信息企业,产业总规模超8500亿元,正迈向万亿级产业集群。 合肥通过投资长鑫科技也实现了产业与城市能级的跃升,带动半导体产业链集聚,并显著提升城市上市公司总市值排名。类似案例还有苏州、成都等地。硬科技投资需要长期耐心与担当,最终能深刻改变产业格局与城市命运。 当前,安徽、湖北等地经济增速亮眼,城市竞争正随着产业变迁而洗牌。一家领军企业可以带动一个产业,一个产业则可以重塑一座城市。

marsbit41分钟前

湖北国资,迎来史上最大回报

marsbit41分钟前

AI投资神话破灭

AI明星基金Situational Awareness(SA)在7月底濒临倒闭,创始人、前OpenAI研究员利奥波德・阿申布伦纳向投资人发出预警。该基金曾凭借对AI的强烈信念和激进策略,在一年内将管理规模从15亿美元飙升至450亿美元,获得包括Stripe创始人、Jane Street等知名投资者的支持。 SA的核心策略是做多AI硬件与算力股,同时做空被认为会被AI取代的软件公司。这看似对冲,实则两头均押注于“市场对AI充满信心”这一单一因子,本质上是一种高杠杆的“德州对冲”式赌博。在市场上涨期,该策略曾带来439%的惊人回报。 然而,7月下旬半导体板块开始大幅回调,SA重仓股价格暴跌。此时,其策略缺陷彻底暴露:多头亏损的同时,空头因软件股上涨也出现亏损。高杠杆放大了损失,基金一周内损失67%的收益,面临保证金追缴危机。尽管阿申布伦纳曾宣称这是“最好的加仓机会”,但形势急转直下。 7月30日,在美股开盘前仅20分钟,SA被迫以折价将全部公开市场持仓紧急出售给城堡投资集团,避免了被银行强制平仓的连锁灾难。交易后,其资产规模从峰值450亿美元骤降至约100亿美元(其持有的Anthropic私募股权未计入此次出售)。投资人如Jane Street因此蒙受数十亿美元账面亏损。 SA的崩盘揭示了其策略蕴含的高集中度、高杠杆与流动性风险。当市场逆转时,三者叠加导致基金迅速陷入“亏得快、卖不掉、补不上保证金”的绝境。此次事件为华尔街敲响警钟,促使市场重新审视AI主题投资的系统性风险。最终问题已无关阿申布伦纳的判断对错,而在于资本是否会继续无视风险,狂热追逐下一个“确定性”神话。

marsbit42分钟前

AI投资神话破灭

marsbit42分钟前

交易

现货
活动图片