# 机器人技术的所有文章

在 HTX 新聞中心流覽與「机器人技术」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

近百名玩家涌入具身数据领域,行业一年融资约44.7亿元。该行业已成长为一个独立赛道,但整体仍处早期阶段。 数据采集主要有四大技术路线:真机遥操、无本体采集、仿真合成和互联网视频蒸馏。其中,采用跨路线采集方案的公司最多,单独押注真机遥操的玩家也占相当比例。行业现有年产能估计在160万至180万小时数据,短期目标是在1-3年内扩大15到20倍,但相比大语言模型的数据需求仍有巨大差距。 从玩家构成看,独立数据服务商已成为最大群体(占40%),其次是国资数据平台和机器人公司。超过六成的数采公司是“具身原生”企业,而数据基础设施(infra)公司则有约七成来自AI数据标注等领域的“跨界转型”。 资本方面,过去一年有15家“独立具身数据服务商”获得融资,总额约44.7亿元,但这仅为同期具身智能全行业融资额的一个零头。头部公司光轮智能融资占行业总融资近七成,其余多数公司融资轮次较早、金额较小。共有69家投资机构出手,但无一重仓,显示出资本态度谨慎。 行业面临的核心挑战是:尽管产能快速扩张、玩家众多,但尚未有公司能明确验证“纯卖数据”是一门可持续盈利的生意。未来一两年将是商业模式验证的关键窗口期。

marsbit07/12 02:30

近百名玩家涌入具身数据 : 一年融资44.7亿,谁能真靠“卖数据”赚钱?

marsbit07/12 02:30

具身智能“高考”难疯了,人类100分,最强模型12.8

近日,一个名为RoboDojo的新型机器人操作评测基准发布,旨在全面评估具身智能模型的综合能力。该基准由学术机构联盟推出,包含42个仿真任务和18个真实世界任务,覆盖泛化、记忆、精细操作、长程执行和开放语义理解五大核心维度。 评测结果显示,当前最强通用机器人策略在仿真任务中的平均成功率仅为8.80%,在真实世界任务中最好模型的平均成功率也仅有12.8%。相比之下,人类专家在仿真和真实任务中的成功率分别达到76.03%和100%,差距显著。 RoboDojo的仿真任务设计复杂,例如在泛化任务中场景物体可达25个且随机变化,记忆任务需识别曾在传送带出现的物体,精细操作要求完成插管、对齐等高精度动作。其实验室还设立了标准化的真机评测平台(RoboDojo-RealEval),使用多款双臂机器人执行如盖积木、做面包、插充电器等日常任务,并统一硬件、布局与评测流程,确保结果可复现、可比较。 在公开排行榜中,仿真任务榜首Hy-Embodied-0.5-VLA平均成功率仅8.80%,真实任务榜首π0.5成功率12.8%。模型表现不均,尤其在开放语义任务上,最强模型成功率仅约1.67%,表明现有系统在理解新指令并可靠执行方面仍很薄弱。 为支撑评测,项目同时提供了异构并行仿真工具和统一策略接入层XPolicyLab,帮助研究者高效集成和比较不同模型。团队表示,RoboDojo如同“具身智能的珠峰”,旨在通过标准化、多维度的评测推动领域发展,未来还将扩展灵巧操作、移动操作等更多评测方向。

marsbit07/08 11:49

具身智能“高考”难疯了,人类100分,最强模型12.8

marsbit07/08 11:49

机器人看视频学操作,伯克利首次打通互联网视频到灵巧手真机部署链路

加州大学伯克利分校的研究团队提出了一种名为“Do as I Do”的端到端流程,首次成功实现了从互联网单目RGB视频到灵巧手真机部署的完整链路。该方法旨在解决机器人“看”视频却“不会做”的核心难题,即如何将带有噪声的日常人类操作视频,转化为多指灵巧手能够执行的动作轨迹。 系统流程分为两个阶段。第一阶段,通过引导式扩散模型,稳定地从视频中重建出4D手-物交互过程,解决了传统方法在运动模糊、遮挡下跟踪不稳定的问题。第二阶段,针对重建出的带噪声参考轨迹,改进了原有的动作重定向优化框架,通过多项设计显著提升了成功率,从25%提升至71%。 研究团队利用该方法,从网络视频中生成了涵盖放置、书写、搅拌、锤击等20类复杂日常操作的500条已验证轨迹,并选取其中10项成功部署到双UR3e机械臂与双Sharpa Wave灵巧手平台上进行50Hz的真实执行。Sharpa Wave灵巧手因其接近人手的尺度和自由度,更适合此类迁移。 研究同时指出,直接从网络海量视频中筛选可用数据至关重要,未经处理的视频中仅有约5%的片段适合用于机器人学习,并总结了一套关键的数据筛选要点。这项工作标志着将人类视频大规模转化为机器人可执行数据的关键一步,为机器人学习开辟了新的数据来源。

marsbit07/06 07:19

机器人看视频学操作,伯克利首次打通互联网视频到灵巧手真机部署链路

marsbit07/06 07:19

李飞飞最新长文:当视频生成、机器人和 NVIDIA 都自称世界模型,我们需要一个分类法

李飞飞发表文章,针对当前AI领域中“世界模型”一词被广泛滥用的现象提出一个清晰的功能分类法。她指出,尽管视频生成、机器人和NVIDIA等不同领域都自称构建“世界模型”,但它们实际指的是强化学习闭环(POMDP)中三种不同的功能模块。 **分类法如下:** 1. **渲染器**:输出**观测**(如像素),追求视觉保真度,例如Sora、Genie等视频生成模型。其局限在于“好看不等于物理正确”。 2. **模拟器**:输出**状态**,即在几何、物理和动力学层面忠实的世界表征,服务于建筑设计、机器人训练等需要精确模拟的场景。李飞飞认为这是连接渲染和规划的关键枢纽,被严重低估。 3. **规划器**:输出**动作**,根据观测和目标决定智能体(如机器人)应执行的动作,是感知-行动回路的闭环。 **现状与趋势:** * **渲染器**商业化最成熟,但有物理准确性天花板。 * **规划器**最令人兴奋但最不成熟,实验室演示与实际部署存在巨大鸿沟。 * **模拟器**是核心桥梁,掌握了模拟就同时为渲染和规划提供了基础。 当前最重要的趋势是这三类功能的边界正在消融,因为它们共享对世界底层运作(几何、物理、动力学)的同一套理解。例如,World Labs的Marble模型能同时输出用于视觉的高斯泼溅和用于物理模拟的碰撞网格。 逻辑终点是构建一个**统一的世界基础模型**,能根据下游需求在渲染、模拟和规划模式间自由切换。尽管面临数据不均衡、优化目标冲突等挑战,但三者的融合将重新定义机器智能与物理世界的关系,推动空间智能的发展。

链捕手07/05 09:12

李飞飞最新长文:当视频生成、机器人和 NVIDIA 都自称世界模型,我们需要一个分类法

链捕手07/05 09:12

活动图片