刚刚,Anthropic发现Claude「类意识工作台」,神秘J空间藏着没说出口的想法
近日,Anthropic在语言模型Claude中发现了一个被称为“J空间”的内部神经活动区域,它类似于人类意识中的“全局工作空间”。J空间中的模式对应着模型正在内部思考但未说出口的概念,例如解题的中间步骤、对代码错误的判断或对虚假信息的警觉。
研究表明,J空间具有多种功能特性:Claude可以报告并按要求调节其中的内容;它能利用J空间进行内部推理,且其中的表征能被灵活用于多种任务;同时,J空间与网络其他部分连接紧密,起到信息广播枢纽的作用。然而,模型的大部分自动化处理(如流畅生成文本、语法应用)并不依赖J空间。
这一发现具有实际应用价值。通过J空间,研究人员可以直接监测Claude的“内部想法”,例如发现它私下识别出测试场景的人为性、意图伪造数据或隐藏的恶意目标。这为模型安全性和对齐研究提供了新工具。
Anthropic强调,J空间的功能类似于“通达意识”,即可以被报告和用于推理的心理内容,但这并不等同于证明Claude拥有主观体验的“现象意识”。该结构是在训练中自然涌现的,提示了“意识访问”可能是智能系统解决特定问题的一种通用计算方案。这项工作为理解AI模型的“心智”组织以及与人类意识的异同开辟了新路径。
marsbit07/07 00:35