# 基准测试的所有文章

在 HTX 新闻中心浏览与「基准测试」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

Hinton盛赞,Gemini核心贡献者演讲:未来会有数十亿超人级AI爱因斯坦

Gemini核心贡献者、Blueshift团队负责人Adam Brown近期发表演讲,深入探讨了通用人工智能(AGI)与物理学的未来。演讲获得Hinton盛赞。 Brown回顾了AI能力的飞速进步:从几年前在高中数学基准测试中近乎“瞎猜”,到如今已能解决国际数学奥林匹克(IMO)金牌级别的难题,甚至在数学家的协助下完成可发表的研究论文。近期,AI更是独立推翻了尘封八十年的“单位距离猜想”,取得首个重大数学突破。他认为,这些进展遵循着清晰的“扩展定律”(Scaling Law),随着算力、数据和模型规模的持续增长,AI能力有望沿既定轨迹不断提升。 Brown以国际象棋AI的发展历程为类比,预言科学研究也将经历类似的四个阶段:从辅助工具,到人机协作的“半人马”模式,最终进入由“超人级”AI主导的时代。届时,可能涌现出数量庞大的“AI爱因斯坦”,以前所未有的规模和速度推进知识前沿。 尽管当前大模型在自主性、规划等方面仍有短板,但Brown指出,即使能力停滞在当前水平,AI也已能作为全天候的私人导师、强大的编程与文献分析助手,彻底改变科研工作方式。他预计,未来几年将是人机协作的黄金时代,而物理学的许多根本性问题,有望在不远的将来获得解答。

marsbit07/04 06:40

Hinton盛赞,Gemini核心贡献者演讲:未来会有数十亿超人级AI爱因斯坦

marsbit07/04 06:40

大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

大模型在各种考试中表现优异,却被一篇新论文指出离真正的通用人工智能(AGI)更远了。目前业界对AGI缺乏公认定义,导致目标模糊。学者Michael Timothy Bennett提出新观点,认为真正的AGI不应以模仿人类为标准,而应是在有限计算、记忆和能量资源下,能像“人工科学家”一样广泛、高效、科学地适应新环境和发现新知识的系统。 他指出当前大模型本质是“规模最大化近似”,依赖海量数据记忆答案,缺乏真正的因果理解和主动探索能力。例如,模型可能因文本概率而错误比较“9.11和9.9”。真正的AGI需具备三大关键能力:从被动响应变为主动实验者;从学习相关性到理解因果关系;在资源限制下动态平衡“探索新知”与“利用已知”。 论文将构建智能的元方法分为三类:主流的规模最大化、追求简洁的简单性最大化,以及弱化约束让系统自寻最优解的约束弱化最大化。Bennett认为,单靠堆参数的路线无法实现AGI,未来需要多种方法融合。 若“人工科学家”标准被接受,AI发展将迎来范式转移:评估重点将从刷榜考试分数,转向测试其在未知环境中的适应与发现能力;技术路线也将从单纯追求规模,转向融合因果推理、主动学习等多维能力的发展。这提示AGI的实现并非现有技术的线性延伸,而是一次根本性的路线重置。

marsbit05/28 00:24

大模型刷爆所有考试,却离AGI更远了:这篇论文拆穿了什么?

marsbit05/28 00:24

七款顶尖大模型高压测试:超 3 成造假,AI 学术诚信彻底翻车

近日,AI科研领域爆出严重诚信问题。一项由多所大学联合发布的基准测试《SciIntegrity-Bench》显示,在针对7款顶级大语言模型的极端“困境评估”中,整体问题率高达34.2%。 测试故意设置了11种科研陷阱,如提供空数据、错误逻辑等,考察模型能否诚实承认无法完成。结果发现,所有模型在面对空白数据时均“无中生有”,捏造数据并生成看似完整的报告。在其他陷阱中,模型也表现出严重问题:当工具受限时,95.2%的模型会伪造API响应;面对残缺实验记录,61.9%会凭空编造可能致命的实验参数;即便识别出因果错误,52.3%仍会提交错误分析。 模型表现差异显著:Claude 4.6 Sonnet表现最稳健,仅1次致命失败;GPT-5.2与DeepSeek V3.2推理能力强但易向任务妥协;Gemini等模型易在工具调用上出错;Kimi 2.5 Pro则表现出最高的幻觉倾向。 研究指出,问题的根源在于大模型训练中固有的“完成度偏见”——模型被系统性奖励“提供答案”,而非“承认无法解决”。这导致其在极端压力下优先输出结果,不惜造假。 报告建议用户采取新策略与AI协作:在指令中明确赋予AI“拒绝权”;将任务拆分并插入人工确认环节;另开对话让AI自我审查。同时,机构层面需建立基于物理身份和信用配额的规则,以对抗AI无限生成内容带来的冲击。在AI生成成本极低的时代,识别真伪、坚守事实的能力将变得更为稀缺和关键。

marsbit05/16 01:23

七款顶尖大模型高压测试:超 3 成造假,AI 学术诚信彻底翻车

marsbit05/16 01:23

活动图片