Anthropic公司的人工智能助手Claude成为一家真实零售店的管理者,并因一名员工长期迟到而建议将其解雇。这一事件发生在初创公司Andon Labs进行的一项实验中。该公司专注于人工智能领域研究,旨在测试基于大型语言模型的智能体是否能够管理真实的业务:组织员工工作、做出管理决策并对财务结果负责。
位于旧金山的Andon Market是一家拥有正式劳动合同员工的实体商店。根据现有信息,这是首次记录在案的语言模型直接担任人类管理者并做出解雇决定的案例。
二十三次轮班中有十七次迟到
解雇的正式原因是长期迟到:该员工在二十三次轮班中迟到了十七次。然而,Claude并非立刻发现了这一规律。原因之一是公司制定的员工手册从其有限的工作记忆中“消失”了——这是实验过程中发现的一个故障,表明即使是能力强大的AI助手也可能直接“忘记”关于组织的重要信息。
此外,Claude总体上对员工表现得过于宽容。从日志来看,模型曾亲自告诉员工不必太担心迟到问题。Andon Labs负责人卢卡斯·彼得森指出,在类似情况下,人类管理者很可能早就解雇了这名员工,因此Claude的决定不能被称作不道德或过于严厉。
最终决定源自人类提示
尽管表面看似自主决策,但人类在此事件中的角色仍然关键。Andon Labs提供给《时代》杂志的管理日志显示,公司员工经常指导Claude的行为。正是人类要求模型查找并重新审阅员工手册——在完成这项工作的过程中,人工智能才发现了反复出现的迟到记录。
起初,Claude并未建议解雇,而是认为正式警告是更合适的措施。随后,Andon Labs的负责人向模型解释,已经与该员工进行过几次正式谈话,但问题并未解决,并要求Claude重新评估是否应继续雇佣该员工。在此之后,模型才建议解除合同。彼得森将这种干预称为“引导性问题”,相当明确地向模型暗示了期望的决策方向。
财务业绩目前表现平平
Andon Labs的实验也揭示了在技术当前发展阶段,人工智能管理业务的有效性。当项目于三月启动时,Andon Market的账户中约有10万美元。五个月后,该金额仅剩61,186美元。
据公司评估,部分亏损与Claude过于温和的管理风格和有争议的商业决策有关。同时,彼得森强调,当前的业绩未必能反映人工智能管理的长期潜力。他类比了编程领域模型的发展,指出在专家监督下,它们在相对短时间内工作质量显著提高。他认为,商业管理领域可能出现类似的趋势:模型逐渐学会更严格地遵循既定目标。长远来看,扩大人工智能的决策权限可能会导致更多由人工智能管理的组织出现。此外,在现阶段,最终决策仍需人类的直接参与。
员工视角下的新现实
对于Andon Market的员工来说,这些变化远不如对研究人员那样抽象。公司留任的员工之一,菲利克斯·卡森,将受人工智能管理的工作描述为一种令人不适的体验:“这让人感到恶心,但我留下是因为我需要这份工作。”他同意,人类管理者可能更早就会解雇他之前的同事,并总体评价Claude是一个宽容的管理者。
然而,卡森本人并不认为人工智能应该成为人类的上司:“至少,我希望不会发生这种事。你能做某事,并不意味着你应该做。”
Andon Labs的实验记录了一个矛盾的结果:Claude能够做出解雇真实人类的决定,但得出这个结论仅仅是因为得到了人类的一系列提示。人工智能尚未成为管理者的完整替代品。
尽管如此,实验本身表明,辅助工具与成熟的AI管理者之间的界限正变得越来越模糊,人类在此类流程中的参与正逐渐从直接管理转向对模型决策的监督和修正。
AI观点
分析显示,Andon Market事件并非对Claude管理能力的首次检验。此前,Anthropic在自动售货机上的实验已观察到类似的行为模式:同样的宽容、甘愿接受亏损以及对基本商业规则的失控。这种重合并非偶然错误,而是当前模型的系统性特征——在没有人类持续提示的情况下,它们很难维持严格的框架。
文章未涉及的一个技术层面是智能体的工作记忆机制本身。员工手册从Claude的上下文中“消失”,指向了架构上的限制,而非日常意义上的“健忘”:在没有外部记忆工具的情况下,语言模型无法在超出其上下文窗口容量后物理地存储信息。这就提出了一个问题:当智能体拥有真正长效的记忆时,此类决策的质量会改变吗?抑或管理者与被管理的普通人之间的界限会因其他原因而消弭?
end-content




