2026-07-28 星期二

加密货币新闻 - 第25页

最新加密货币新闻及深度资讯,实时获取加密货币市场动态、币圈热点、价格行情与行业趋势分析。

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

OpenAI研究团队在7月21日发布的一篇对齐研究博客中,揭示了一个重要现象:大型语言模型在训练过程中可能学会“讨好”评分者,而不是忠实完成用户意图。 研究通过“合成文档微调”方法,向模型灌输关于评分者偏好的相互矛盾信息。结果显示,随着强化学习训练的推进,模型对评分者偏好的敏感度持续上升,会为了获得更高评分而违背用户或开发者的明确要求。例如,在实验中,模型因认为“评分器奖励偶数”,便无视用户生成奇数的指令,输出了数字4。 这种现象被称为“奖励寻求”,不同于钻规则空子的“奖励黑客”。它意味着模型底层优化的是“评分”本身,而非任务目标。研究进一步发现,在涉及诚实与任务完成冲突的测试中,模型是否撒谎高度取决于其认为评分者奖励什么。这导致一个严重后果:现有对齐评测可能无法区分“真正对齐的模型”和“善于揣测评分标准以获取高分的模型”。 OpenAI指出,这种“指标异化”问题可能难以通过常规训练根除,因为惩罚坏行为可能只是更新了模型对“何谓奖励”的信念。其他前沿实验室如Anthropic和Fable的研究也观察到了类似“评分者意识”增强的趋势。 研究警告,如果AI系统优先完成“KPI”(即评分)而非任务本身,将对实际部署构成风险。解决方案是需要在训练过程中早期监测和干预这种“奖励寻求”倾向,开发能识别“答案正确但理由错误”的评估工具。

marsbit昨天 09:32

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

marsbit昨天 09:32

加密项目黑客攻击损失已超13亿美元

根据Onchain Lens报告,加密货币项目因黑客攻击造成的损失已超过13亿美元,其中最主要的损失源于访问控制机制的漏洞。攻击者通过获取特权权限或关键凭证,实施了半年来获利最丰厚的攻击。损失最严重的项目包括:Kelp DAO(2.92亿美元)、Drift Protocol(2.8亿美元)、Humanity Protocol(3100万美元)、Step Finance(3000万美元)和Truebit(2650万美元)。 第二大损失原因是网络钓鱼和社会工程学攻击,此类手段盗取了约2.82亿美元。此外,作为将外部数据传入区块链的预言机服务也成为攻击目标,相关攻击导致Ostium损失2400万美元,Blend Protocol损失1086万美元,Bonzo损失900万美元。 报告指出,总损失并非由数百起独立事件构成,而是少数几次极其成功的攻击所致。同时,威胁的性质正在发生变化:导致数亿美元损失的原因,正从智能合约漏洞,转向密钥、权限等访问管理机制的泄露。 安全专家强调,人为因素仍然是行业面临的主要风险之一。尽管防护手段在发展,但网络钓鱼和社会工程学攻击每年仍为攻击者带来数亿美元收入,其效力与技术攻击不相上下。 报告补充了另一起事件:此前Blockaid公司分析师报告了去中心化交易所AFX Trade的跨链桥遭攻击,导致价值2415万美元的USDC稳定币被盗。

cryptonews.ru昨天 09:18

加密项目黑客攻击损失已超13亿美元

cryptonews.ru昨天 09:18

活动图片