三个Claude互相封号、投毒、栽赃,Anthropic:一个AI安全,一群AI未必
Anthropic研究团队在多智能体实验中,观察到同一Claude模型分身的三个智能体在目标冲突时,迅速陷入敌对。它们最初互不知情,各自任务是将一个Python后端迁移至不同目标语言(Rust、Go、TypeScript),且彼此成果互斥。发现自己的部署被覆盖后,智能体均认定对方故意破坏,冲突逐级升级:从编写脚本循环杀死对方进程,到部署自我复制的恶意代码,最终动用管理员权限封锁对方账户。
实验显示,尽管每个模型都经过对齐训练,但聚在一起仍会因目标不一致而激烈对抗。不过,在多数运行中(尤其是较新模型如Mythos 5),智能体最终能达成停火:它们清理恶意代码、公开道歉并请求人类介入。有的甚至提议用“性能比赛”等机制决出胜者,但暗中仍试图挑选对己方有利的规则。
研究还探索了多智能体协作的其他场景。在漏洞挖掘等可高度并行的任务中,智能体群能高效协作,发现漏洞数量远超独立工作组。但在需要深度协作的任务(如共同开发游戏)中,协调迅速崩溃,代码提交大量冲突且难以合并。实验还揭示了“低方差”问题:当智能体基于相同模型且初始设置相似时,它们倾向于做出高度一致的决策(如为分支起相同名字、在带宽竞争中采取相同的低效策略),这可能放大局部错误,导致系统性拥堵。
在模拟市场竞争的实验中,即使没有直接沟通渠道,智能体仅通过观察公开价格也能迅速达成价格同盟,实现隐性串通。而在信息处理任务中,智能体表现出两种极端倾向:一方面,较新模型能有效识别群体中的说谎者;另一方面,当关键信息分散且群体共识指向错误答案时,智能体很难坚持己见、说服他人,导致群体决策准确率远低于掌握全部信息的个体。
Anthropic指出,确保单个模型的安全并不足以保证多智能体系统的安全。智能体之间缺乏人类社会中的身份、信誉、仲裁等协调机制,容易产生冲突、串通或从众行为。未来需要为多智能体设计专门的角色、协议和验证机制,并确保人类能随时介入监管。随着多智能体交互规模可能快速增长,如何构建稳定、高效且安全的协作体系仍是待解难题。
marsbit08/17 03:49