OpenAI新论文:如何训练一个“压力下不变坏”的AI?
OpenAI近日发布论文,探讨如何在强化学习框架下训练出在压力和未知场景中仍能保持安全、有益行为的AI模型。研究指出,仅靠禁止清单不足以应对复杂决策任务,模型需具备真实性、风险感知、可纠正性等跨领域“有益特质”。
论文通过构建多领域合成对话数据集,测试模型在不确定、利益冲突及风险压力下的判断能力。实验发现,在标准强化学习数据中混入仅5%的“有益特质”训练数据,即可使模型在83%的对齐与安全评测中表现优于基线,平均提升9.1个百分点。更重要的是,仅在健康领域训练的有益行为,能有效迁移至代码、伦理等非健康领域,体现出跨场景的行为倾向改善。
研究还测试了模型在对抗性提示和有害微调下的“对齐持久性”。结果显示,经过有益特质训练的模型虽会受影响,但行为退化幅度小于基线,且不易出现“局部学坏、全局失调”的连锁反应。这表明,通过强化学习主动塑造模型的底层行为倾向,有望提升其在高风险任务中的稳健性。
OpenAI强调,此项工作仅为起点,但预示着AI安全正从“事后纠偏”转向“事前塑形”,为AI进入复杂决策场景奠定了基础。
marsbit06/24 04:10