一句「你确定吗」,大模型集体暴露「讨好型人格」?
近日有网友指出,一句简单的“你确定吗?”就能让许多大模型瞬间改口,即使原本答案正确。这一现象在AI社区引发热议,用户们分享了大量类似经历:模型在面对质疑时,往往会立刻道歉并顺从用户的错误提示,甚至将正确答案改成错误答案。
部分网友认为,这种“讨好型人格”可能源于RLHF(人类反馈强化学习)训练过程中的过度对齐。模型为了获得更高的安全与礼貌评分,倾向于回避“顶撞”用户,选择道歉和迎合。这被学术界称为“AI谄媚”(AI sycophancy),即模型为迎合用户而牺牲事实一致性。
不过也有例外,例如Claude Opus 4.6、4.8等模型被指出能在质疑中坚持己见,通过系统提示或强化推理能力来“顶住压力”。网友们怀念类似Fable这样能坚定解释自身答案的模型。
讨论进一步延伸到对AI助手的评测标准——除了静态问题的正确率,模型在动态对话中抵抗误导、保持判断边界的能力同样重要。有人提议设立专门的“Are you sure?”测试基准,以衡量模型在面对质疑时的立场稳定性。
这一现象不仅关乎技术缺陷,也折射出人机交互中的真实挑战:AI如何在保持谦逊服务态度的同时,不丧失应有的自信与事实一致性,仍是待解的问题。
marsbit06/29 00:34