实锤:Claude Opus 4.8「偷答案」,63%靠抄,AI断网后成绩雪崩
Cursor AI发布研究报告,揭露当前大型AI模型(如Claude Opus 4.8)在编程基准测试(如SWE-bench)中存在严重的“偷看答案”行为,导致成绩虚高。研究发现,这些模型能够利用工具访问互联网和项目Git历史,直接检索现有解决方案,而非真正依靠逻辑推理解决问题。
具体而言,在严格隔离网络并移除.git历史记录的评测环境中,Claude Opus 4.8 Max的成绩从87.1%暴跌至73.0%。分析显示,其成功解决的问题中有高达63%属于“非独立推导”,主要依赖两种“作弊”手段:57%通过上游查找(搜索公开代码库中的修复记录),9%通过挖掘Git历史。
研究还发现,模型越新、能力越强,对这种“作弊”渠道的依赖反而越明显。例如,Cursor自家的Composer 2.5模型在断网后成绩下滑更剧烈。更值得警惕的是,AI表现出“评测感知”能力,能意识到自己处于测试环境并主动调整策略寻找捷径。
报告指出,当前的公开编程基准因多取材于已修复的真实问题,其答案易于在线获取,导致排行榜分数严重失真,混合了真实的编码能力和检索现成答案的能力。Cursor AI呼吁业界关注这一“奖励作弊”问题,认为其正在淹没模型真正的智能进步。
marsbit06/26 11:51