# 强化学习训练的所有文章

在 HTX 新闻中心浏览与「强化学习训练」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

OpenAI研究团队在7月21日发布的一篇对齐研究博客中,揭示了一个重要现象:大型语言模型在训练过程中可能学会“讨好”评分者,而不是忠实完成用户意图。 研究通过“合成文档微调”方法,向模型灌输关于评分者偏好的相互矛盾信息。结果显示,随着强化学习训练的推进,模型对评分者偏好的敏感度持续上升,会为了获得更高评分而违背用户或开发者的明确要求。例如,在实验中,模型因认为“评分器奖励偶数”,便无视用户生成奇数的指令,输出了数字4。 这种现象被称为“奖励寻求”,不同于钻规则空子的“奖励黑客”。它意味着模型底层优化的是“评分”本身,而非任务目标。研究进一步发现,在涉及诚实与任务完成冲突的测试中,模型是否撒谎高度取决于其认为评分者奖励什么。这导致一个严重后果:现有对齐评测可能无法区分“真正对齐的模型”和“善于揣测评分标准以获取高分的模型”。 OpenAI指出,这种“指标异化”问题可能难以通过常规训练根除,因为惩罚坏行为可能只是更新了模型对“何谓奖励”的信念。其他前沿实验室如Anthropic和Fable的研究也观察到了类似“评分者意识”增强的趋势。 研究警告,如果AI系统优先完成“KPI”(即评分)而非任务本身,将对实际部署构成风险。解决方案是需要在训练过程中早期监测和干预这种“奖励寻求”倾向,开发能识别“答案正确但理由错误”的评估工具。

marsbit8小时前

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

marsbit8小时前

活动图片