# 具身智能的所有文章

在 HTX 新聞中心流覽與「具身智能」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

李飞飞的世界模型宣言

AI专家李飞飞近期发表技术博客,引用维特根斯坦“世界即所发生的一切”的观点,指出当前生成式AI虽能熟练处理语言,却缺乏对物理世界本质的理解。她强调,真正的“世界模型”应让机器超越文本统计,掌握物理空间与时间规律,这是实现具身智能的关键。 针对“世界模型”概念日益模糊的现状,李飞飞提出了一个基于“部分可观测马尔可夫决策过程”的清晰框架,并拆解出其三大核心组件:渲染器、模拟器和规划器。 * **渲染器**:负责生成视觉上合理、美观的像素画面(如Sora等视频生成模型),但可能缺乏物理真实性。 * **模拟器**:追求对物理规律的严格遵循,是连接渲染与规划的枢纽,也是当前最薄弱但至关重要的环节,英伟达的Omniverse是该领域的代表。 * **规划器**:负责决策与行动输出,是机器从“观察者”变为“实践者”的关键。 李飞飞认为,模拟器是实现AI工业化的核心,但其发展面临高质量3D物理数据稀缺、生成内容存在物理错误(如“穿模”)等巨大挑战。她同时预测,渲染、模拟与规划三者的界限正变得模糊,未来将趋向于一个统一的、可交互的基础模型,能无缝切换于视觉表现与物理仿真之间。 最终,李飞飞指出,构建世界模型的竞争本质是定义物理世界数字标准的竞争,这是AI从“谈论世界”走向“理解并与世界交互”的必经之路,是迈向通用人工智能(AGI)的重要一步,但前路依然漫长。

marsbit06/09 00:36

李飞飞的世界模型宣言

marsbit06/09 00:36

首次,纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功

微软亚洲研究院与清华大学合作提出创新预训练框架VITRA,首次实现仅使用纯人类视频数据对视觉-语言-动作(VLA)模型进行大规模预训练,并成功应用于机器人灵巧操作。 该研究核心是构建了一套自动化流程,将海量无标注的人类活动视频转化为可用于机器人训练的V-L-A数据。方法包括:从单目视频中精准恢复3D手部与相机运动轨迹;基于手部移动速度极小值进行原子级动作分割;结合视觉与轨迹信息,利用大模型自动生成语言指令。由此构建了包含百万片段、千万帧的超大规模数据集。 基于此数据集预训练的VLA模型,结合了视觉语言模型骨干与扩散动作预测器。模型在完全未见的真实环境中展现出强大的零样本手部动作预测能力。仅需使用约1.2千条真实机器人数据对预训练模型进行微调,即可在配备灵巧手(如星动XHAND1)的真实机器人上成功执行抓取、放置、倾倒等多种复杂操作任务,并对新物体、新环境表现出卓越的泛化能力和鲁棒性。 研究还验证了模型性能随预训练数据规模增加而提升的缩放定律。该工作为利用丰富易得的人类视频数据突破机器人训练数据瓶颈提供了新路径,推动了面向真实复杂场景的具身智能发展。

marsbit06/08 08:53

首次,纯人类视频预训练VLA灵巧操作,少量数据微调就能部署成功

marsbit06/08 08:53

国内首例具身数据合规出海:帕西尼何以成为行业发展的破局者?

“具身智能数据合规出海”迎来关键进展。在2026世界智能产业博览会上,帕西尼感知科技牵头的“全国首例具身智能数据跨境”项目在天津启动。帕西尼成为国内目前唯一获准开展具身数据跨境业务的企业,成功开辟了合规出海的国际通道。 具身智能作为AI发展的重要方向,其演进高度依赖海量、多维的物理世界交互数据。尽管全球需求爆发,但行业此前受限于严苛的合规门槛,难以实现数据合规出境。帕西尼率先走通官方审批流程,打通了从数据采集、加工、认证到出境的全程合规链路,树立了行业规范化发展的标杆。 其破局的核心在于领先的数据基础设施与合规安全架构。帕西尼建成了百亿级高质量全模态数据的“数采工厂”,拥有强大的规模化数据生产能力,同时在国内率先实现了数据跨境的全流程合规。这不仅支撑了自身发展,也契合国家推动数据要素高效流通的战略方向。 该项目的成功,为帕西尼带来了国际资本(如摩根士丹利、高盛)的认可,并构筑了“最大数采工厂”与“唯一合规通道”的双重竞争壁垒。帕西尼通过解决数据基座与合规出海的基础设施难题,为全球具身智能产业提供了“中国样本”,有望在产业长跑中持续释放中国智能制造的全球影响力。

marsbit06/05 06:43

国内首例具身数据合规出海:帕西尼何以成为行业发展的破局者?

marsbit06/05 06:43

解读宇树 IPO 招股书:机器人市场的真实图景

宇树机器人(Unitree Robotics)近日提交科创板IPO申请,计划融资6.2亿美元。其招股书揭示了当前人形机器人市场的真实图景:硬件已跑通,但大规模商业化仍待AI模型突破。 **关键数据与业务现状:** * **市场地位**:2025年人形机器人出货约5500台,按出货量计全球第一。 * **收入结构**:业务重心已从四足机器人转向人形机器人,后者在2025年前三季度贡献超半数核心收入。 * **客户构成(人形机器人)**: * **科研教育**:占74%,是当前最主要的收入来源。 * **商业消费**:占17%,主要用于零售、景点等场所的“展示”与招揽。 * **工业应用**:仅占9%,且其中过半用于企业接待导览,真正用于巡检等生产场景的极少。 * **四足机器人**:商业化更成熟,超40%收入来自商业用途,客户包括国家电网、京东等,用于真实巡检场景。 **核心竞争力与策略:** * **垂直整合**:自主设计制造电机、关节模块等核心部件,外购成本仅占14-18%。此策略显著降低成本并推高毛利率,2025年毛利率近60%。 * **财务表现**:2025年收入预计达2.52亿美元(同比增长335%),2024年已实现GAAP盈利。IPO目标估值约60-70亿美元。 **未来战略与挑战:** * **软件投入**:计划将约3亿美元IPO募资用于AI模型训练,开发“具身大模型”(VLA和WMA架构),以应对硬件可能商品化的风险,构建长期护城河。 * **行业阶段**:宇树的现状反映了机器人行业仍处早期。广泛的工业与消费级应用,有待AI模型能力实现关键突破后才能真正开启。

marsbit05/25 04:22

解读宇树 IPO 招股书:机器人市场的真实图景

marsbit05/25 04:22

活动图片