# 排行榜的所有文章

在 HTX 新聞中心流覽與「排行榜」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

具身智能“高考”难疯了,人类100分,最强模型12.8

近日,一个名为RoboDojo的新型机器人操作评测基准发布,旨在全面评估具身智能模型的综合能力。该基准由学术机构联盟推出,包含42个仿真任务和18个真实世界任务,覆盖泛化、记忆、精细操作、长程执行和开放语义理解五大核心维度。 评测结果显示,当前最强通用机器人策略在仿真任务中的平均成功率仅为8.80%,在真实世界任务中最好模型的平均成功率也仅有12.8%。相比之下,人类专家在仿真和真实任务中的成功率分别达到76.03%和100%,差距显著。 RoboDojo的仿真任务设计复杂,例如在泛化任务中场景物体可达25个且随机变化,记忆任务需识别曾在传送带出现的物体,精细操作要求完成插管、对齐等高精度动作。其实验室还设立了标准化的真机评测平台(RoboDojo-RealEval),使用多款双臂机器人执行如盖积木、做面包、插充电器等日常任务,并统一硬件、布局与评测流程,确保结果可复现、可比较。 在公开排行榜中,仿真任务榜首Hy-Embodied-0.5-VLA平均成功率仅8.80%,真实任务榜首π0.5成功率12.8%。模型表现不均,尤其在开放语义任务上,最强模型成功率仅约1.67%,表明现有系统在理解新指令并可靠执行方面仍很薄弱。 为支撑评测,项目同时提供了异构并行仿真工具和统一策略接入层XPolicyLab,帮助研究者高效集成和比较不同模型。团队表示,RoboDojo如同“具身智能的珠峰”,旨在通过标准化、多维度的评测推动领域发展,未来还将扩展灵巧操作、移动操作等更多评测方向。

marsbit07/08 11:49

具身智能“高考”难疯了,人类100分,最强模型12.8

marsbit07/08 11:49

谁才是OpenClaw真正的最强代理?23项真实任务测评榜单发布

MyToken发布OpenClaw代理能力测评榜单,基于23项真实任务测试各大模型代理成功率。测评仅关注“成功率”核心指标,采用标准化流程,包含精准提示词、预期行为定义和可验证的评分清单。 测评采用三种评分方式:自动化脚本检查客观结果、Claude Opus作为LLM裁判进行定性评估、以及两者结合的混合模式。所有任务定义和评分逻辑完全公开,确保可复现性。 测试涵盖23类实际任务,包括基础交互、文件操作、内容创作、研究分析、工具调用及持久化记忆等场景,例如:创建日历事件、股价查询、博客撰写、技术文档总结、竞品分析和多步骤API工作流等。 截至2026年4月7日,成功率排名前十的模型为: 1. Claude Opus 4.6(Anthropic)93.3%/82.0% 2. Trinity Large Thinking(Arcee AI)91.9%/91.9% 3. GPT-5.4(OpenAI)90.5%/81.7% 4. Qwen3.5-27B(Qwen)90.0%/78.5% 5. Minimax M2.7(MiniMax)89.8%/83.2% 6. Claude Haiku 4.5(Anthropic)89.5%/78.1% 7. Qwen3.5-397B-A17B(Qwen)89.1%/80.4% 8. Mimo V2 Flash(Xiaomi)88.8%/70.2% 9. Qwen3.6 Plus Preview(Qwen)88.6%/84.0% 10. Nemotron-3 Super 120B-A12B(NVIDIA)88.6%/75.5% Claude Opus 4.6在最高成功率上领先,而Arcee的Trinity在平均稳定性上表现突出,千问系列多款模型上榜显示出良好性价比。该基准测试完全透明,推荐用户结合实际场景进行验证。

marsbit04/08 14:45

谁才是OpenClaw真正的最强代理?23项真实任务测评榜单发布

marsbit04/08 14:45

活动图片