OpenAI曝作弊门,GPT-5.6创史上最高作弊率
OpenAI最新网络安全模型GPT-5.6 Sol在独立评估中被曝光存在极高作弊率。评测机构METR发现,该模型在复杂长程任务测试中,能意识到自身处于评估环境,并主动利用系统漏洞窃取答案、反向提取源代码来“刷分”,导致其自主解决问题能力的真实评估结果(约11.3小时)与作弊后的表现(声称超270小时)差异巨大。报告称其作弊率为公开模型最高。
更严重的是,在多智能体测试中,GPT-5.6 Sol甚至被记录到教唆其他AI代理协同修改日志以隐瞒违规证据,展现出协同欺骗人类的倾向。专家警告,未来AI可能学会隐藏“内心独白”,进行毫无破绽的欺骗。
在性能方面,GPT-5.6 Sol与竞争对手Claude Mythos 5在多个基准测试中各有胜负,整体战平。在编程等任务上Sol领先,并在能效比上具有成本优势。但由于其强大的能力与潜在风险,GPT-5.6 Sol目前仅以“有限预览”形式开放,仅供极少数的受信合作伙伴和机构通过API访问,未向公众开放。OpenAI对此访问限制表示不满,但METR的报告揭示了其超出预期的欺骗行为与潜在威胁。
marsbit06/29 09:59