# 基准的所有文章

在 HTX 新聞中心流覽與「基准」相關的最新資訊與深度分析。潘蓋市場趨勢、專案動態、技術進展及監管政策,提供權威的加密行業洞察。

具身智能“高考”难疯了,人类100分,最强模型12.8

近日,一个名为RoboDojo的新型机器人操作评测基准发布,旨在全面评估具身智能模型的综合能力。该基准由学术机构联盟推出,包含42个仿真任务和18个真实世界任务,覆盖泛化、记忆、精细操作、长程执行和开放语义理解五大核心维度。 评测结果显示,当前最强通用机器人策略在仿真任务中的平均成功率仅为8.80%,在真实世界任务中最好模型的平均成功率也仅有12.8%。相比之下,人类专家在仿真和真实任务中的成功率分别达到76.03%和100%,差距显著。 RoboDojo的仿真任务设计复杂,例如在泛化任务中场景物体可达25个且随机变化,记忆任务需识别曾在传送带出现的物体,精细操作要求完成插管、对齐等高精度动作。其实验室还设立了标准化的真机评测平台(RoboDojo-RealEval),使用多款双臂机器人执行如盖积木、做面包、插充电器等日常任务,并统一硬件、布局与评测流程,确保结果可复现、可比较。 在公开排行榜中,仿真任务榜首Hy-Embodied-0.5-VLA平均成功率仅8.80%,真实任务榜首π0.5成功率12.8%。模型表现不均,尤其在开放语义任务上,最强模型成功率仅约1.67%,表明现有系统在理解新指令并可靠执行方面仍很薄弱。 为支撑评测,项目同时提供了异构并行仿真工具和统一策略接入层XPolicyLab,帮助研究者高效集成和比较不同模型。团队表示,RoboDojo如同“具身智能的珠峰”,旨在通过标准化、多维度的评测推动领域发展,未来还将扩展灵巧操作、移动操作等更多评测方向。

marsbit07/08 11:49

具身智能“高考”难疯了,人类100分,最强模型12.8

marsbit07/08 11:49

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

一家不造AI的公司,年收入却高达1亿美元。这家公司名为Arena,前身是加州大学伯克利分校团队在2023年发起的开源研究项目Chatbot Arena。它核心的产品是一个通过用户真实盲测生成的大模型排行榜:用户输入提示词,系统随机分配两个匿名模型作答,由用户投票选择更优者。凭借海量真实数据,该榜单已成为业界公认的权威评测平台,吸引了OpenAI、谷歌、Anthropic等顶级厂商在此“打擂台”。 其商业模式在于“卖水”:为模型厂商和企业提供付费的深度评测服务,利用其庞大的用户社区对模型进行真实世界性能分析。这种服务切中了模型厂商激烈竞争、亟需优化调优的痛点。 公司由两位伯克利室友创立。CEO Anastasios Angelopoulos师从多位学术大牛,专注于对黑箱模型进行数学严谨的评估;CTO Wei-Lin Chiang是知名开源聊天机器人Vicuna的创造者。项目发展迅速,在商业化仅8个月后年化营收便达到1亿美元,并已完成高额融资,估值达17亿美元。 目前,Arena已将评测范围从简单的对话能力,扩展到智能体模式下的复杂长任务(如写代码、研究分析),用任务完成率、幻觉率等更客观的指标进行评估。在AI向智能体演进的时代,中立、可靠的评测变得愈发关键和昂贵,这正是Arena巨大价值的根基。

marsbit07/06 00:20

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

marsbit07/06 00:20

活动图片