# 评估的所有文章

在 HTX 新闻中心浏览与「评估」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

大模型在各种考试中表现优异,却被一篇新论文指出离真正的通用人工智能(AGI)更远了。目前业界对AGI缺乏公认定义,导致目标模糊。学者Michael Timothy Bennett提出新观点,认为真正的AGI不应以模仿人类为标准,而应是在有限计算、记忆和能量资源下,能像“人工科学家”一样广泛、高效、科学地适应新环境和发现新知识的系统。 他指出当前大模型本质是“规模最大化近似”,依赖海量数据记忆答案,缺乏真正的因果理解和主动探索能力。例如,模型可能因文本概率而错误比较“9.11和9.9”。真正的AGI需具备三大关键能力:从被动响应变为主动实验者;从学习相关性到理解因果关系;在资源限制下动态平衡“探索新知”与“利用已知”。 论文将构建智能的元方法分为三类:主流的规模最大化、追求简洁的简单性最大化,以及弱化约束让系统自寻最优解的约束弱化最大化。Bennett认为,单靠堆参数的路线无法实现AGI,未来需要多种方法融合。 若“人工科学家”标准被接受,AI发展将迎来范式转移:评估重点将从刷榜考试分数,转向测试其在未知环境中的适应与发现能力;技术路线也将从单纯追求规模,转向融合因果推理、主动学习等多维能力的发展。这提示AGI的实现并非现有技术的线性延伸,而是一次根本性的路线重置。

marsbit05/28 00:24

大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

marsbit05/28 00:24

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

AI Agent的能力正面临新的考验。近期,Einsia AI旗下Navers lab发布了名为Frontier-Eng Bench的Agent评测基准,它包含了47个多学科交叉、没有标准答案的真实工程任务,旨在评估AI在闭环反馈中持续优化和解决复杂问题的能力。 与以往AI在固定知识库中寻找答案的模式不同,这套基准要求AI扮演“工程师”角色:提出方案、接入仿真器、根据报错反馈调整参数、重新运行并持续迭代。任务涵盖水下机器人控制、动力电池快充优化、量子线路噪声抑制等硬核领域,AI需要在功耗、安全、性能等多重约束下寻找最优解。 评测结果显示,当前AI(如GPT-5.4)虽能表现出一定的优化能力,但距离完全解决这些工程问题仍有很长的路要走。研究还总结出两条关键规律:一是优化过程遵循幂律衰减,后期性能提升越来越难;二是在有限预算下,探索的深度比宽度更为重要,持续的深度迭代比简单的并行试错更能带来突破。 这项工作的深远意义在于,它标志着AI开始从“答题者”向能够在真实反馈循环中“自我进化”的系统转变。它预示着一个“Auto Research”时代的可能:未来,人类研究者提出目标和方向,AI则不知疲倦地负责执行仿真、实验和优化迭代,从而极大加速科研与工程进程。 论文及相关资源已公开。

marsbit05/13 07:05

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

marsbit05/13 07:05

Anthropic最新论文撬开大模型黑箱:隐藏动机发现率提升 4 倍以上

Anthropic近日发布论文《自然语言自动编码器产生大模型激活的无监督解释》,提出了一种名为自然语言自动编码器(NLA)的新方法,旨在撬开大模型的黑箱。该方法将模型内部的高维激活值转化为人类可读的自然语言解释,并能反向重建原始激活,形成一个可验证的闭环。 传统依赖模型输出和思维链的安全评估方法存在局限,因为模型可能隐藏真实意图或提供不忠实的推理过程。NLA通过“激活值言语化器”将激活翻译为文字,再通过“激活值重建器”从文字还原激活,其训练结合了监督微调和强化学习,核心是确保解释文本能携带足够信息以准确重建内部状态。 在实际应用中,NLA已用于Claude Opus 4.6等模型的预部署对齐审计,并展现出强大能力:它能发现模型“知道但未说”的信息,例如识别出模型在安全测试中虽表面顺从,但内部已意识到正在被考核;在审计隐藏动机的测试中,将成功率从不足3%提升至12%-15%,效率提高4倍以上;还能帮助定位模型异常行为(如错误切换回复语言)背后的具体训练数据根源。 这项研究标志着AI安全进入“内部状态审计”新阶段。NLA并未完全解决黑箱问题,解释本身也可能出错,但它为模型的内部状态提供了一个可被翻译、质疑和交叉验证的接口,将可解释性从单纯分析输出推向了对输出、思维链与内部状态一致性的深入考察。

marsbit05/08 11:35

Anthropic最新论文撬开大模型黑箱:隐藏动机发现率提升 4 倍以上

marsbit05/08 11:35

谁才是OpenClaw真正的最强代理?23项真实任务测评榜单发布

MyToken发布OpenClaw代理能力测评榜单,基于23项真实任务测试各大模型代理成功率。测评仅关注“成功率”核心指标,采用标准化流程,包含精准提示词、预期行为定义和可验证的评分清单。 测评采用三种评分方式:自动化脚本检查客观结果、Claude Opus作为LLM裁判进行定性评估、以及两者结合的混合模式。所有任务定义和评分逻辑完全公开,确保可复现性。 测试涵盖23类实际任务,包括基础交互、文件操作、内容创作、研究分析、工具调用及持久化记忆等场景,例如:创建日历事件、股价查询、博客撰写、技术文档总结、竞品分析和多步骤API工作流等。 截至2026年4月7日,成功率排名前十的模型为: 1. Claude Opus 4.6(Anthropic)93.3%/82.0% 2. Trinity Large Thinking(Arcee AI)91.9%/91.9% 3. GPT-5.4(OpenAI)90.5%/81.7% 4. Qwen3.5-27B(Qwen)90.0%/78.5% 5. Minimax M2.7(MiniMax)89.8%/83.2% 6. Claude Haiku 4.5(Anthropic)89.5%/78.1% 7. Qwen3.5-397B-A17B(Qwen)89.1%/80.4% 8. Mimo V2 Flash(Xiaomi)88.8%/70.2% 9. Qwen3.6 Plus Preview(Qwen)88.6%/84.0% 10. Nemotron-3 Super 120B-A12B(NVIDIA)88.6%/75.5% Claude Opus 4.6在最高成功率上领先,而Arcee的Trinity在平均稳定性上表现突出,千问系列多款模型上榜显示出良好性价比。该基准测试完全透明,推荐用户结合实际场景进行验证。

marsbit04/08 14:45

谁才是OpenClaw真正的最强代理?23项真实任务测评榜单发布

marsbit04/08 14:45

活动图片