# 模拟的所有文章

在 HTX 新闻中心浏览与「模拟」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

近百名玩家涌入具身数据领域,行业一年融资约44.7亿元。该行业已成长为一个独立赛道,但整体仍处早期阶段。 数据采集主要有四大技术路线:真机遥操、无本体采集、仿真合成和互联网视频蒸馏。其中,采用跨路线采集方案的公司最多,单独押注真机遥操的玩家也占相当比例。行业现有年产能估计在160万至180万小时数据,短期目标是在1-3年内扩大15到20倍,但相比大语言模型的数据需求仍有巨大差距。 从玩家构成看,独立数据服务商已成为最大群体(占40%),其次是国资数据平台和机器人公司。超过六成的数采公司是“具身原生”企业,而数据基础设施(infra)公司则有约七成来自AI数据标注等领域的“跨界转型”。 资本方面,过去一年有15家“独立具身数据服务商”获得融资,总额约44.7亿元,但这仅为同期具身智能全行业融资额的一个零头。头部公司光轮智能融资占行业总融资近七成,其余多数公司融资轮次较早、金额较小。共有69家投资机构出手,但无一重仓,显示出资本态度谨慎。 行业面临的核心挑战是:尽管产能快速扩张、玩家众多,但尚未有公司能明确验证“纯卖数据”是一门可持续盈利的生意。未来一两年将是商业模式验证的关键窗口期。

marsbit07/12 02:30

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

marsbit07/12 02:30

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

AI模型Fable 5近期重新上线,其强大的3D世界生成能力引发了广泛关注。AI评测平台Arena.ai的Peter Gostev利用该模型,仅用约1600行代码,便一次性生成了63个复杂且细节丰富的互动3D场景,涵盖城市景观、自然奇观、艺术名画再现、微观视角及科幻想象等多个主题。 其中最令人惊叹的包括一座沉于水下的曼哈顿,其建筑、街道纹理栩栩如生;以及将梵高《星空》、莫奈《睡莲》等名画解构成可穿梭飞行的三维空间。这些场景不仅视觉震撼,更展现出模型对物理交互、动态细节(如熊捕鱼时鱼的挣扎)的深层理解与跨模态生成能力。 著名AI研究员、刚加入Anthropic的Andrej Karpathy观看后深感震撼,认为模型在创造丰富、可玩世界方面实现了质的飞跃,并提出了“fablemaxxing”一词来形容这种突破。 Gostev指出,Fable 5的优势在于能协调海量元素一次性生成连贯世界,显著减少了调试时间。尽管其在复杂游戏性上仍有局限,部分生成结果需筛选,但其在Arena.ai的Agent Arena榜单上已以巨大优势登顶,证明了其强大的实际任务完成能力。 此次演示揭示了当前AI模型在空间理解与创造性构建方面的惊人进步。无论是开发者还是使用者,都可能发现过去模型无法完成、而新一代模型可以胜任的新领域。探索才刚刚开始。

marsbit07/06 09:48

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

marsbit07/06 09:48

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

世界模型是当前AI领域的热门概念,旨在让机器像人类一样,在行动前通过“脑内沙盘”预演和推演未来。其核心思想可追溯至1943年心理学家Kenneth Craik提出的“心智模型”,以及AI先驱Marvin Minsky的“框架理论”。2018年,David Ha与Jürgen Schmidhuber的论文将这一概念带入深度学习主流。 当前,学界和产业界对世界模型的定义尚未统一。Yann LeCun强调其应理解物理规律,提出JEPA架构;李飞飞则基于POMDP框架,将世界模型分为渲染器、模拟器和规划器三类;清华大学FIB-Lab将其功能归纳为“理解世界”与“预测未来”。OpenAI的Sora、Google DeepMind的Genie 3、英伟达的Cosmos等大厂产品,分别从视频生成、3D交互、物理仿真等角度切入。 技术路线主要分为三类:一是“画画”路线,即生成式视频模型,视觉逼真但物理一致性弱;二是“心算”路线,预测抽象表征,效率高但可解释性差;三是“搭积木”路线,生成精确的三维环境,可控但泛化能力有限。发展趋势是三者融合,并向World Action Model(WAM)演进,实现状态预测与动作生成的联合学习。 产业链已形成基础支撑层、技术平台层和场景应用层三层结构,在自动驾驶、具身智能等领域应用广泛。尽管概念尚未统一,但这反映了技术早期的多元探索,最终目标都是让机器拥有可推演、可泛化的内部世界模型,以实现更安全、高效和通用的智能行为。

marsbit06/29 05:08

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

marsbit06/29 05:08

世界模型、元宇宙、数字孪生、物理AI:它们是一回事吗?

过去几年,元宇宙、Web3.0、仿真数据平台、数字孪生、物理AI等概念轮番登场。它们与世界模型并非同一回事,但都指向数字世界与物理世界边界模糊的大趋势。世界模型更像是这些概念的“认知层”或“底层操作系统”,负责让AI理解并推演世界。 这些概念大致可分三类:一是“空间体验”如元宇宙;二是“生产关系”如Web3.0;三是“技术能力”如仿真数据平台、数字孪生、物理AI和世界模型。世界模型属于第三类,且更为底层。 具体来看:元宇宙是虚拟空间体验,世界模型可能成为其内容生成的“发动机”。Web3.0聚焦于所有权与经济规则,与世界模型基本不在同一技术图层。仿真数据平台可视为世界模型的1.0版本,后者旨在实现场景生成的智能化。数字孪生是现实的镜像,而世界模型更进一步,具备预测未来的能力。物理AI指能在物理世界行动的AI,世界模型是其理解与推演世界的核心组件。 在层次结构中,世界模型处于认知层,向上支撑应用工具层(如仿真平台、数字孪生)、行动层(物理AI)和体验层(元宇宙),向下依赖算力和数据。它可能成为连接数字与物理世界的共同底座,就像操作系统支撑各类应用。这些概念当初描绘的愿景,其实现很可能离不开世界模型的发展。

marsbit06/28 10:41

世界模型、元宇宙、数字孪生、物理AI:它们是一回事吗?

marsbit06/28 10:41

没有统一名字的战争:国内各家大厂的世界模型版图

世界模型是AI领域的关键方向,但业内尚未有统一命名,常被称为世界基座模型、物理AI或融入自动驾驶大模型等。其核心目标是让机器在行动前,在内部构建可推演、复盘的动态环境,将真实世界压缩为可无限生成和测试的数据引擎,从而减少对真实数据的依赖。 国内各大厂商已积极布局。**互联网巨头**中,阿里推出了面向语言、虚拟和物理世界的三个模型;腾讯侧重3D可编辑世界,服务于游戏和社交;字节跳动依托短视频数据秘密研发;华为、百度则将其作为智能汽车与自动驾驶的底层能力,不单独强调概念。**车企**将世界模型视为“驾校和考场”,用于生成和测试驾驶场景,提升智能驾驶系统能力,如蔚来、理想、小鹏、吉利等均有具体布局。**智驾供应商**如Momenta、地平线、毫末智行等,则将世界模型作为“隐形引擎”,嵌入端到端系统中,以强化仿真训练和闭环验证。 创业公司虽专注灵活,但面临数据、算力和商业化闭环的挑战;而大厂凭借数据、算力和现有业务体系,正将世界模型从研究项目转化为业务底座。竞争正从“能否做出模型”转向“能否实现规模化应用”。世界模型并非短暂风口,而是语言大模型、视频生成、自动驾驶等技术在物理世界交汇的必然升级,成为未来产业基础设施的核心。

marsbit06/25 06:51

没有统一名字的战争:国内各家大厂的世界模型版图

marsbit06/25 06:51

机器人开始“吃数据”:从印度数据工厂到百亿美元人形机器人的隐秘生产链

随着具身智能行业的发展,机器人训练对高质量数据的需求急剧增长,催生了一条隐秘的数据生产链。与依赖互联网文本数据的大语言模型不同,具身模型面临物理世界的“数据荒漠”,人类第一视角视频(Ego Data)等真实世界经验成为关键。 在印度等地,出现了专门采集人类工作视频的“数据工厂”。工人们佩戴头戴摄像头和数据手套,按照严格规范完成整理、抓取等任务,产出结构化视频与动作数据,出售给欧美等地的机器人公司。这类Ego Data成本相对较低,可用于模型预训练,让机器人理解人类如何完成任务。 数据价值呈现“金字塔”结构:底层是低成本互联网视频;上层是带精细动作标注的Ego数据;再往上是仿真合成数据,可大规模生成但存在与现实差距;顶层是最稀缺、昂贵的真机遥操数据,直接指导机器人本体动作。 行业上游已分化为多类玩家:低成本数据工厂、专注动作捕捉与重定向的服务商、提供真机遥操数据的第三方、仿真合成数据公司,以及探索数据标准与流通的平台。机器人公司则采取“分层采购”策略:通用Ego数据倾向外包以快速获取规模;而关乎自身硬件适配的核心真机数据与部署中产生的失败数据,则多由自己掌控以构建壁垒。 当前,行业竞争焦点正从硬件与模型架构,转向高质量数据的持续供给与有效利用。能否建立高效的数据采集、标注、仿真扩增与反馈闭环,将成为影响机器人能力突破的关键。这条从全球劳动力密集区延伸到顶尖机器人公司的数据供应链,正在支撑着百亿美元估值的人形机器人迈向现实应用。

marsbit06/13 03:32

机器人开始“吃数据”:从印度数据工厂到百亿美元人形机器人的隐秘生产链

marsbit06/13 03:32

李飞飞的世界模型宣言

AI专家李飞飞近期发表技术博客,引用维特根斯坦“世界即所发生的一切”的观点,指出当前生成式AI虽能熟练处理语言,却缺乏对物理世界本质的理解。她强调,真正的“世界模型”应让机器超越文本统计,掌握物理空间与时间规律,这是实现具身智能的关键。 针对“世界模型”概念日益模糊的现状,李飞飞提出了一个基于“部分可观测马尔可夫决策过程”的清晰框架,并拆解出其三大核心组件:渲染器、模拟器和规划器。 * **渲染器**:负责生成视觉上合理、美观的像素画面(如Sora等视频生成模型),但可能缺乏物理真实性。 * **模拟器**:追求对物理规律的严格遵循,是连接渲染与规划的枢纽,也是当前最薄弱但至关重要的环节,英伟达的Omniverse是该领域的代表。 * **规划器**:负责决策与行动输出,是机器从“观察者”变为“实践者”的关键。 李飞飞认为,模拟器是实现AI工业化的核心,但其发展面临高质量3D物理数据稀缺、生成内容存在物理错误(如“穿模”)等巨大挑战。她同时预测,渲染、模拟与规划三者的界限正变得模糊,未来将趋向于一个统一的、可交互的基础模型,能无缝切换于视觉表现与物理仿真之间。 最终,李飞飞指出,构建世界模型的竞争本质是定义物理世界数字标准的竞争,这是AI从“谈论世界”走向“理解并与世界交互”的必经之路,是迈向通用人工智能(AGI)的重要一步,但前路依然漫长。

marsbit06/09 00:36

李飞飞的世界模型宣言

marsbit06/09 00:36

从代码到认知:机器人大脑进化的万字指南

本文概述了机器人大脑从传统代码控制到现代人工智能模型驱动的演进历程。文章首先回顾了前大型语言模型(LLM)时代,机器人依赖手工编码的模块化技术栈(感知、状态估计、规划、控制)和行为树,虽稳定但泛化能力差。随后,深度学习改进了感知,强化学习和模仿学习进入了控制层,但策略仍较为狭窄。 ChatGPT的出现带来了转折。LLM最初被用作自然语言编译器,将指令转化为机器人可执行的原子技能序列(如谷歌的SayCan)。但更重要的突破是视觉-语言-动作模型(VLA),例如谷歌的RT-2和开源的OpenVLA,它能将视觉、语言信息融合,直接输出动作指令,实现了推理与行动的耦合。 目前最先进的系统采用“双脑”架构(如Figure AI的Helix、NVIDIA GR00T):一个慢速、参数多的“系统2”负责高层次推理和规划;一个快速、小巧的“系统1”负责高频动作生成。其下还可能有一个“系统0”反射层处理平衡等底层控制。出于延迟和可靠性考虑,安全关键的控制回路通常在机器人本地(如NVIDIA Jetson模块)运行,而对话界面和集群学习等任务可交由云端。 开源模型(如OpenVLA、GR00T、π0)降低了行业门槛,让初创公司能在其基础上用自有数据微调。然而,当前VLA机器人仍存在任务中途恢复能力弱、样本效率低、缺乏物理常识和长期规划能力等局限。 这催生了下一代方向:世界模型。这类模型(如NVIDIA Cosmos、Meta V-JEPA)能根据当前状态和动作预测未来结果,让机器人在行动前进行模拟和评估,从而改善恢复能力、泛化能力和长期规划。架构上主要分为像素级视频扩散、联合嵌入预测架构(JEPA)和潜在动作世界模型等流派。 文章最后指出,数据采集(特别是远程操作数据)是核心竞争力,仿真训练至关重要,机器人成本正在迅速下降。当前物理AI的发展阶段大约相当于“GPT-2时代”,虽未完全自主,但正通过架构的持续演进(从代码到感知、规划、策略,最终到世界模型),朝着更通用、更强大的方向稳步前进。

marsbit06/07 12:55

从代码到认知:机器人大脑进化的万字指南

marsbit06/07 12:55

活动图片