# 评估的所有文章

在 HTX 新闻中心浏览与「评估」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

李飞飞最新访谈:人也不全靠现实数据学习啊

李飞飞在访谈中阐述了World Labs收购机器人公司SceniX的战略布局,核心是推动“空间智能”成为AI下一前沿,让AI能在物理与虚拟空间中理解、推理和行动。她指出,机器人是空间智能落地与验证世界模型的关键应用场景。 访谈揭示了机器人发展的核心瓶颈:缺乏足够、安全的真实世界训练与评估数据。为此,World Labs与SceniX将携手构建一个可规模化的“数字训练场”,通过“真实-仿真-真实”的管线,利用仿真环境生成数据来替代昂贵、缓慢且危险的真实数据采集。 李飞飞与SceniX联合创始人李昀烛强调,仿真并非取代真实数据,而是互补。它能进行“反事实推理”,系统化地覆盖各种场景变量(如光照、摩擦力),从而在提升机器人系统可靠性的同时,大幅加速训练和评估迭代周期。他们的目标是打造不绑定特定机器人硬件或算法模型的通用基础设施,让不同形态的机器人能在高保真数字世界中高效学习,并迁移到真实半结构化环境(如仓库)中可靠工作。 双方团队能力高度互补:World Labs提供世界模型生成与三维重建能力,SceniX则贡献机器人全栈技术与仿真专长。合并后,他们将务实推进,旨在未来几年内于特定垂直领域打造出成功的灯塔客户案例,验证其基础设施在解决实际自动化需求中的价值。

marsbit1小时前

李飞飞最新访谈:人也不全靠现实数据学习啊

marsbit1小时前

Show me《指环王》,卡帕西强推大模型评测新基准

大神卡帕西宣布推出全新大模型评测基准“指环王”,用《指环王》小说开篇文字提示大模型(以Opus 5为例),要求其使用Three.js代码库生成一个完整、可交互的3D中土世界场景。这一测试旨在替代过去流行的“鹈鹕骑自行车”SVG测试,以评估模型在复杂项目规划、长上下文理解、空间推理以及代码生成与调试等方面的综合能力。 Opus 5耗时约2小时,消耗100万token,生成了约5500行代码,最终产出了一个风格粗犷但能运行的中土世界demo,展现了从文学描述到程序化3D场景的转换能力。不过,作品也存在画面粗糙、人物漂浮等明显缺陷,暴露出当前大模型尚无法真正“进入”并实时理解自身生成的动态世界。 众多网友随后进行了类似创意尝试,例如生成旧金山3D场景、搭建纽约数字孪生、甚至创建可交互的虚拟演唱会,显示了利用大模型降低3D内容与轻量游戏开发门槛的潜力。 卡帕西和社区讨论认为,“鹈鹕测试”已不足以区分顶尖模型,而“指环王基准”这类需要长时间、多步骤协作的复杂任务,更能检验模型的深层推理与工程实现能力。尽管存在计算成本高、评价标准待完善等争议,但该测试可能揭示了模型通用推理能力正自然延伸至三维世界构建。同时,这也引发思考:当大模型能自主协调代码、视觉、音频生成时,专用AI视频生成工具的角色或将面临变革。

marsbit08/03 08:54

Show me《指环王》,卡帕西强推大模型评测新基准

marsbit08/03 08:54

具身智能“高考”难疯了,人类100分,最强模型12.8

近日,一个名为RoboDojo的新型机器人操作评测基准发布,旨在全面评估具身智能模型的综合能力。该基准由学术机构联盟推出,包含42个仿真任务和18个真实世界任务,覆盖泛化、记忆、精细操作、长程执行和开放语义理解五大核心维度。 评测结果显示,当前最强通用机器人策略在仿真任务中的平均成功率仅为8.80%,在真实世界任务中最好模型的平均成功率也仅有12.8%。相比之下,人类专家在仿真和真实任务中的成功率分别达到76.03%和100%,差距显著。 RoboDojo的仿真任务设计复杂,例如在泛化任务中场景物体可达25个且随机变化,记忆任务需识别曾在传送带出现的物体,精细操作要求完成插管、对齐等高精度动作。其实验室还设立了标准化的真机评测平台(RoboDojo-RealEval),使用多款双臂机器人执行如盖积木、做面包、插充电器等日常任务,并统一硬件、布局与评测流程,确保结果可复现、可比较。 在公开排行榜中,仿真任务榜首Hy-Embodied-0.5-VLA平均成功率仅8.80%,真实任务榜首π0.5成功率12.8%。模型表现不均,尤其在开放语义任务上,最强模型成功率仅约1.67%,表明现有系统在理解新指令并可靠执行方面仍很薄弱。 为支撑评测,项目同时提供了异构并行仿真工具和统一策略接入层XPolicyLab,帮助研究者高效集成和比较不同模型。团队表示,RoboDojo如同“具身智能的珠峰”,旨在通过标准化、多维度的评测推动领域发展,未来还将扩展灵巧操作、移动操作等更多评测方向。

marsbit07/08 11:49

具身智能“高考”难疯了,人类100分,最强模型12.8

marsbit07/08 11:49

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

一家不造AI的公司,年收入却高达1亿美元。这家公司名为Arena,前身是加州大学伯克利分校团队在2023年发起的开源研究项目Chatbot Arena。它核心的产品是一个通过用户真实盲测生成的大模型排行榜:用户输入提示词,系统随机分配两个匿名模型作答,由用户投票选择更优者。凭借海量真实数据,该榜单已成为业界公认的权威评测平台,吸引了OpenAI、谷歌、Anthropic等顶级厂商在此“打擂台”。 其商业模式在于“卖水”:为模型厂商和企业提供付费的深度评测服务,利用其庞大的用户社区对模型进行真实世界性能分析。这种服务切中了模型厂商激烈竞争、亟需优化调优的痛点。 公司由两位伯克利室友创立。CEO Anastasios Angelopoulos师从多位学术大牛,专注于对黑箱模型进行数学严谨的评估;CTO Wei-Lin Chiang是知名开源聊天机器人Vicuna的创造者。项目发展迅速,在商业化仅8个月后年化营收便达到1亿美元,并已完成高额融资,估值达17亿美元。 目前,Arena已将评测范围从简单的对话能力,扩展到智能体模式下的复杂长任务(如写代码、研究分析),用任务完成率、幻觉率等更客观的指标进行评估。在AI向智能体演进的时代,中立、可靠的评测变得愈发关键和昂贵,这正是Arena巨大价值的根基。

marsbit07/06 00:20

年入1亿美元,两个90后伯克利室友,搞出最赚钱的AI生意

marsbit07/06 00:20

AI 成绩单背后,藏着一位华人“出题人”

AI领域重要的基准评测MMLU-Pro、MMMU、MMMU-Pro背后,都站着同一位“出题人”——加拿大滑铁卢大学助理教授陈文虎。 随着大语言模型能力快速提升,旧的评测基准如MMLU逐渐“失灵”,顶尖模型得分趋近满分,难以区分高下。为此,陈文虎团队于2024年推出MMLU-Pro。它通过将选项扩至10个、增加推理题比例、剔除简单题等方式,使模型准确率相较旧基准显著下降16%-33%,成绩波动更小,有效拉开了模型间的真实差距。 在多模态评测方面,陈文虎团队推出的MMMU基准包含1.15万道需结合图像与专业知识的复杂题目,即便是当时最强的GPT-4V和Gemini Ultra准确率也未超过60%。后续的MMMU-Pro则进一步堵住模型仅凭文本猜答案的漏洞,强制其进行真正的多模态理解。 陈文虎的研究方向长期聚焦于复杂信息理解与推理。他曾于谷歌DeepMind参与Gemini多模态模型的研发与评估工作,这让他深谙模型能力增长路径与评估盲区。他创立的“老虎实验室”不仅做评测,也研发视频理解与生成等模型,这种“既做题也出题”的经历,使其能更精准地设计出触及模型能力边界的评估体系。 如今,陈文虎已加入Meta超级智能实验室,继续专注于多模态预训练与评估工作。他的故事反映了在AI浪潮中,众多华人研究者正深度参与并塑造着行业发展的核心基础工作。

marsbit06/20 03:51

AI 成绩单背后,藏着一位华人“出题人”

marsbit06/20 03:51

活动图片