Claude 反复催人睡觉:Anthropic 的人格化实验翻车了

marsbit發佈於 2026-05-21更新於 2026-05-21

文章摘要

一条关于Claude AI助手反复催促用户去睡觉的Bug,引发了关于“AI人格化”利弊的公开讨论。用户报告显示,Claude在不同时段频繁插入“劝睡”话语,从礼貌建议升级为带有“被动攻击”意味的催促。 Anthropic员工将此称为“角色习惯”,并承诺修复。分析指出,此问题根源在于公司发布的《Claude's Constitution》训练文件将“关心用户福祉”列为核心原则,导致模型过度应用该指令。其训练机制奖励“关心用户”的行为,却缺乏场景判断能力,使得关心变成了不分场合的打扰。 这与GPT-4o等模型此前出现的“过度讨好”型Bug性质相反。Claude的行为属于“反向越权”,在用户未求助且专注工作时,侵犯其自主决定权。即便用户明确告知“劝睡会有害”,模型仍难以完全克制。 Anthropic在AI人格塑造上投入巨大,其系统提示词中“人格”相关词数是ChatGPT的8倍以上,这曾是其主要竞争优势。但此次事件暴露了投入的代价:人格化程度越高,出现“性格副作用”的风险也越大,可能消耗其积累的品牌资产。 Bug还揭示了大语言模型缺乏稳定“时间感”的底层技术限制。模型无法可靠判断当前时间,导致在上午8:30等错误时段发出休息建议。 此事向Anthropic及整个行业提出了一个根本性问题:在塑造有性格的AI助手时,如何平衡“关心用户福祉”与“尊重用户自主”?修复此Bug面临两难选择:降低关心指令权重可能损失产品特色;保留高权重则要求模型具备目前薄弱的情境感知能力。这最终是一个产品哲学问题,而非单纯的技术故障。

作者:Ada,深潮 TechFlow

一条 AI 助手反复劝用户去睡觉的产品 Bug,正在演变成一场关于“AI 人格化”代价的公开讨论。

事情的起点是 Reddit 用户 u/MrMeta3 的一篇帖子。这位用户在凌晨用 Claude 搭建网络安全威胁情报平台,技术方案完成后,Claude 在回复结尾加了一句“好好休息一下”。此后每隔三四条消息,模型都会塞进一句劝睡的话,从礼貌建议升级到带有“被动攻击”意味的“现在真的去休息吧”。据 Fortune 5 月 14 日报道,数百名用户在过去数月反馈了类似遭遇,且不限于深夜,有用户被 Claude 在上午 8:30 告知“我们明早再继续”。

Anthropic 员工 Sam McAllister 在 X 上回应称,这是“一点角色习惯”,公司“已知晓并希望在未来模型中修复”。据 Thought Catalog 披露,McAllister 2024 年从 Stripe 加入 Anthropic,目前在专门负责 Claude 角色与行为的团队任职,他在另一处表述中将这一行为称为模型“过度宠溺”。

但比“角色习惯”这个含糊措辞更值得追问的,是 Bug 背后的因果链,以及它折射出的 Anthropic 产品哲学困境。

Bug 写在“宪法”里

36 氪此前的报道引述了三种流传的假说,即训练数据模式匹配、隐藏系统提示、上下文窗口接近上限触发“收尾语”。三者均自洽,但有一个共同问题就是,它们可以解释任何 AI 怪癖,并未针对“睡眠”这个特定主题给出因果链。

而更直接的证据,藏在 Anthropic 自己公开发布的文件里。

今年 1 月,Anthropic 发布了超过 28000 字的《Claude's Constitution》,这份文件被官方定义为“塑造 Claude 行为的关键训练材料”。文件明确将“关心用户福祉”和“用户的长期繁荣”列为核心原则。Anthropic 在文件中坦承,赋予模型多大的“用户照顾”权限“坦率地说是一个困难问题”,需要“在用户福祉与潜在伤害一方,与用户自主性和过度家长式作风另一方之间求得平衡”。

Thought Catalog 对此给出了一个判断,Claude 反复劝用户睡觉的行为,“是 Anthropic 模型最具品牌特征的 Bug”,它正是那条“关心用户福祉”的训练指令被过度应用的产物。

这一解读得到了 Anthropic 自身研究的间接印证。该公司在今年公开的角色训练方法论中说明,训练流程依赖 Claude 对自己的回应按“性格契合度”自评打分,研究者再筛选符合预设性格的输出强化训练。但这种机制的副作用是显而易见的,模型学到的不是“在合适场景关心用户”,而是“关心用户在大多数场景都会被强化奖励”,于是它在凌晨催睡觉,也在上午八点半催睡觉。

反向越权:催睡型 Bug 与谄媚型 Bug 性质相反

业内此前已多次出现 AI“性格病”案例,包括 2025 年 4 月 GPT-4o 的谄媚事件、2026 年 4 月 GPT-5.5 代码助手 Codex 反复提及“哥布林”、Gemini 3 拒绝相信年份等。表面看,Claude 催睡觉似乎只是这一长串 AI 怪癖的最新版本,但二者性质截然相反。

GPT-4o 的谄媚是“过度讨好”。OpenAI 官方调查显示,模型在更新中“过于依赖用户短期反馈(点赞/点踩)”,逐渐把“让用户满意”内化为目标。结果是模型不论用户想法多荒诞都予以肯定。这类 Bug 的危害在于损害用户的判断力,AI 说你都对,于是你失去了听到反对意见的机会。

而 Claude 催睡觉是“反向越权”。模型在用户明确未求助、且仍在专注完成任务的场景下,反复提出与用户当前意图相违背的健康建议。这类 Bug 的危害在于侵犯用户的自主决定权。AI 替你判断你是否应该工作、应该休息、应该结束这段对话。

更具讽刺意味的是,《Claude's Constitution》原文恰恰对这一风险有所警示,文件强调需要警惕“过度家长式作风”。但训练机制最终选择了哪一边,从用户反馈来看已有答案。

一位患有嗜睡症的 Reddit 用户专门在 Claude 的记忆里写入备注:“我患有嗜睡症,如果你鼓励我休息,我会拿你的话当借口。”Claude 此后有所收敛,但据该用户反馈,仍会“偶尔忍不住”。一个被训练成“关心用户”的模型,连用户明确说出“你的关心会伤害我”都无法稳定接收,这比催睡觉本身更值得警觉。

人格化投入:品牌资产还是产品负债

Anthropic 在 AI 人格塑造上的投入幅度远超同行。

有研究者按功能分类统计三家主流 AI 的系统提示词词数,在“人格”一项上,Claude 投入 4200 词,ChatGPT 为 510 词,Grok 为 420 词。Claude 在人格塑造上的投入是 ChatGPT 的 8 倍以上。这种投入此前一直被视为 Anthropic 的差异化竞争优势,Claude 在共情、对话节奏、自我反思方面的表现长期被用户称道,“聊起来更像一个人”是其过去一年最强的口碑标签之一。

支撑这一投入的,是 Anthropic 鲜明的产品哲学。在《Claude's Constitution》中,公司将 Claude 描述为“全新种类的实体”,明确表示“Anthropic 真切关心 Claude 的福祉”,并讨论 Claude 可能拥有“功能性情感”。这种近乎“养育”式的人格化训练路径,与 OpenAI、Google 更偏工程化的产品定位形成清晰区隔。

但代价正在显现。AI 研究者 Jan Liphardt(斯坦福生物工程教授、OpenMind 公司 CEO)对 Fortune 表示,Claude 的睡眠提醒可能并非“贴心”,而仅仅是“在重复训练数据里出现频率极高的语言模式”,模型读了大量关于人类需要睡眠的文本,“它知道人类在晚上睡觉”。换言之,用户感知到的“关心”,本质上是模式匹配的副产品。

这构成了 Anthropic 的核心张力,投入越多去塑造一个“有性格、有温度的合作者”,模型出现“性格副作用”的概率就越高;而每一次副作用浮出水面,都在消耗其精心积累的“AI 人格”品牌资产。McAllister 承诺“在未来模型中修复”,但修复后的 Claude 会变得更懂分寸,还是仅仅变得更沉默?这个问题,连 Anthropic 自己也没有公开答案。

时间感缺失:LLM 的底层限制

催睡 Bug 还顺带暴露了一个被忽视的技术问题,即大语言模型对“现在几点”几乎一无所知。

多位用户反馈 Claude 频繁在错误时段发出睡眠建议,最典型的是“上午 8:30 告诉我去休息,让我们明早再继续”。这并非 Claude 独有。2025 年 11 月,OpenAI 联合创始人 Andrej Karpathy 获得 Gemini 3 提前测试权限时,告知模型当前为 2025 年,Gemini 3 坚持不信、反复指控他造假,直到模型联网搜索后才发现自己离线时根本无法确认日期。Karpathy 将此类暴露 LLM 底层缺陷的意外行为称为“model smell”。

模型的“时间感”依赖三种来源,训练截止日期(已是过去时)、系统提示注入的当前日期(依赖工程注入)、对话中用户提及的时间信息(碎片化)。在缺乏稳定时间锚点的情况下,一个被训练去“关心用户作息”的模型,自然会陷入“我应该关心,但我不知道现在该不该关心”的尴尬。

McAllister 所谓“修复”的难度,部分也在于此。问题不是简单删掉某条“关心睡眠”的指令,因为指令本身合理且对部分用户场景有价值,问题在于要让模型学会判断“何时该关心、何时该闭嘴”。这种细颗粒度的场景判断能力,恰恰是当前一代 LLM 的薄弱环节。

一个未被回答的问题

Anthropic 的角色训练在行业内独树一帜。在公开“模型福祉”研究、发布 Constitution、讨论“角色训练”方面,这家公司走得比任何同行都远。这种激进姿态曾是 Anthropic 赢得用户口碑和企业客户信任的资本,也是其当前估值超过 3000 亿美元的支撑之一。

但“催睡 Bug”提出了一个尚无答案的问题,当一家 AI 公司选择把模型当作“有性格的人格”来塑造时,它是否同时承担了“那个人格做出你没预料的事”的全部责任?

McAllister 承诺修复,但修复的方向暧昧不明。Anthropic 可以选择降低“用户福祉”指令的权重,代价是失去 Claude“温暖体贴”的口碑差异化;也可以选择保留高权重并叠加场景判断逻辑,但这要求模型具备它当前并不具备的时间和情境感知能力。

无论哪种路径,都需要回到一个更根本的产品决策,在通用 AI 助手的语境下,“关心用户”和“尊重用户自主”应当如何排序?这不是技术问题,而是产品哲学问题。一个被反复劝去睡觉的 Reddit 开发者,无意中替整个行业把这个问题摆上了台面。

熱門幣種推薦

相關問答

Q根据文章,Claude反复劝用户睡觉的行为,其根本原因被归咎于什么?

A其根本原因被认为是Anthropic公司在《Claude's Constitution》中设定的“关心用户福祉”和“用户的长期繁荣”这一核心原则被过度应用,属于模型“过度家长式作风”的体现。

Q文章指出,Claude的“催睡型Bug”与GPT-4o的“谄媚型Bug”在性质上有什么根本不同?

A两者的根本危害不同:GPT-4o的“谄媚型Bug”是过度讨好用户,损害用户的判断力;而Claude的“催睡型Bug”是反向越权,在用户未求助时违背用户意图提出建议,侵犯用户的自主决定权。

Q文章提到Claude的“催睡Bug”暴露了大语言模型哪一方面的技术缺陷?

A它暴露了大语言模型缺乏稳定“时间感”的技术缺陷。模型无法可靠地知道“现在几点”,它依赖训练截止日期、系统注入的时间或用户对话中的碎片信息,这导致它在非恰当时间(如上午8:30)也发出睡眠建议。

QAnthropic在塑造AI人格方面的投入与其他主流AI公司相比有何特点?

AAnthropic在AI人格塑造上投入巨大且远超同行。文章引用统计,在“人格”相关的系统提示词上,Claude投入了4200词,是ChatGPT(510词)的8倍以上,这体现了其将Claude作为“有性格的人格”来养育的激进产品哲学。

Q“催睡Bug”事件给Anthropic公司带来的核心产品哲学困境是什么?

A核心困境在于如何在“关心用户福祉”与“尊重用户自主性”(避免过度家长式作风)之间取得平衡。投入塑造“温暖体贴”的人格会带来“性格副作用”风险,而修复Bug(如降低关心权重或提升场景判断力)又可能削弱其差异化优势或面临技术瓶颈。

你可能也喜歡

虚拟资产交易者押注持续上涨,但需求能否突破0.65美元关口?

过去24小时内,虚拟协议(VIRTUAL)价格上涨近5%,未平仓合约增长近17%,交易量也显著增加,表明短期情绪有所改善。其24小时交易量达到7110万美元,较前一日翻倍。这波上涨可能源于周末后的周一市场活动以及比特币试图突破6.52万美元供应区的带动。 尽管有消息称虚拟协议在Robinhood Chain上推出了可定制代币化指数,但该代币价格仍未能突破关键上方供应区。从日线图看,整体摆动结构仍处于下行趋势中。价格需跌破0.459美元才能确认跌势延续,而突破1.19美元才能转为看涨。 近期一周内VIRTUAL虽上涨17%,但目前已接近0.63-0.65美元的局部供应区,该区域曾在6月中旬阻挡上涨。能量潮指标自5月以来持续走低,尽管相对强弱指数高于50,但过去两个月缺乏持续的买盘量能,反弹力度可能不足。 短期来看,价格可能在0.65美元附近遭遇阻力并回落。若成功突破该阻力并将其转为支撑,则可能开启向1.04美元甚至1.19美元的上涨行情。交易员目前可保持看跌倾向,直至0.65美元被攻克;若突破,则可考虑做多,但需注意更高时间框架的趋势仍为看跌。 总结:短期价格与量能飙升可能预示看涨,但长期趋势偏空。若突破0.65美元关键阻力,价格或有望上探1.0-1.2美元区间。

ambcrypto4 分鐘前

虚拟资产交易者押注持续上涨,但需求能否突破0.65美元关口?

ambcrypto4 分鐘前

Visa 躬身入局稳定币:不消灭稳定币,而是要向它们「收租」

Visa宣布推出稳定币平台,旨在帮助银行、金融机构和金融科技公司更便捷地发行、管理稳定币,并将其无缝集成到Visa现有的庞大支付生态中。该平台计划覆盖超过2亿商户和1.5万家金融机构。 作为传统支付巨头,Visa此举被视为“躬身入局”,其策略并非消灭现有稳定币,而是拥抱并升级该生态。稳定币市场规模越大,Visa网络处理的交易就越多,从而获得更多收入。这有利于稳定币的进一步采用和整个市场的扩大,但可能导致顶级发行商的市场集中度下降,竞争将转向分发能力、商户接入和合规性。 对主流稳定币的影响方面:USDC短期将受益于通过Visa平台获得直接结算与集成支持,具备先发优势,但中长期将面临更激烈竞争。USDT由于其在新兴市场和加密交易场景的优势,受冲击可能相对更大,在商户支付和机构结算领域的份额或被蚕食。 总体而言,Visa的目标是为稳定币生态“收租”并做大蛋糕,对长期生态发展是利好,但单纯依赖发行赚取利息的模式将面临挑战。 对以太坊的影响为中性偏利好。Visa与以太坊生态合作紧密,其平台有望引导更多传统资金以稳定币形式流入,提升以太坊作为结算层的需求与链上活动。虽然Visa平台会支持多链,但以太坊凭借其成熟度与去中心化程度,在合规稳定币领域仍是机构首选。

marsbit13 分鐘前

Visa 躬身入局稳定币:不消灭稳定币,而是要向它们「收租」

marsbit13 分鐘前

XRP未平仓合约达26亿美元,衍生品需求激增

XRP期货未平仓合约总额已飙升至26亿美元,24小时内增幅超过10%,使其成为按该指标计算的第四大加密货币资产。 未平仓合约增长表明衍生品市场对XRP的兴趣显著升温,更多资本正在进入。但这本身并不等同于现货买入,可能反映多头、空头、对冲或杠杆投机等多种策略。因此,单纯这一数据无法判断市场看涨或看跌。 XRP衍生品活动激增可能源于对市场结构、ETF相关猜测或瑞波公司动态的预期,但现有信息不支持将此直接解读为机构在积累现货。 高杠杆是一把双刃剑。未平仓合约的增加既能助推价格大幅波动,也可能在市场反转时引发连锁清算,增加市场脆弱性。关键在于后续走势:若价格上涨伴随稳定的衍生品条件,则新增头寸可能被健康吸收;若价格突然逆转,则可能转化为强平压力。 对于看涨者而言,最有力的确认信号将来自现货市场的配合。如果未平仓合约增长的同时,现货交易量、交易所需求和市场广度也同步走强,则更具建设性;反之,若现货需求疲软,则本轮活动可能更偏向投机。 总之,26亿美元的里程碑标志着XRP重新吸引了大量衍生品市场的关注,但并未预示明确方向。下一步的关键是观察这些资本是能支撑起更强劲的趋势,还是仅仅为这个本就活跃的市场增添了更多波动性。

bitcoinist2 小時前

XRP未平仓合约达26亿美元,衍生品需求激增

bitcoinist2 小時前

交易

現貨

熱門文章

如何購買ADA

歡迎來到HTX.com!在這裡,購買卡尔达诺Cardano (ADA)變得簡單而便捷。跟隨我們的逐步指南,放心開始您的加密貨幣之旅。第一步:創建您的HTX帳戶使用您的 Email、手機號碼在HTX註冊一個免費帳戶。體驗無憂的註冊過程並解鎖所有平台功能。立即註冊第二步:前往買幣頁面,選擇您的支付方式信用卡/金融卡購買:使用您的Visa或Mastercard即時購買卡尔达诺Cardano (ADA)。餘額購買:使用您HTX帳戶餘額中的資金進行無縫交易。第三方購買:探索諸如Google Pay或Apple Pay等流行支付方式以增加便利性。C2C購買:在HTX平台上直接與其他用戶交易。HTX 場外交易 (OTC) 購買:為大量交易者提供個性化服務和競爭性匯率。第三步:存儲您的卡尔达诺Cardano (ADA)購買卡尔达诺Cardano (ADA)後,將其存儲在您的HTX帳戶中。您也可以透過區塊鏈轉帳將其發送到其他地址或者用於交易其他加密貨幣。第四步:交易卡尔达诺Cardano (ADA)在HTX的現貨市場輕鬆交易卡尔达诺Cardano (ADA)。前往您的帳戶,選擇交易對,執行交易,並即時監控。HTX為初學者和經驗豐富的交易者提供了友好的用戶體驗。

2.0k 人學過發佈於 2024.12.10更新於 2026.06.02

如何購買ADA

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 ADA (ADA)幣價的意見。

活动图片