Karpathy确诊“AI精神病”!不吃不睡每天16小时养龙虾

marsbit发布于2026-03-23更新于2026-03-23

文章摘要

前OpenAI联合创始人Karpathy自曝患上“AI精神病”,每天工作16小时不吃不睡,完全依赖AI智能体进行编程和日常管理。他在五个月前还认为智能体技术不成熟,但自去年12月起,Claude和Codex等模型的能力突破让他彻底改变看法,从80%手写代码”转变为“80%交由AI处理”。 Karpathy形容自己如同管理一支AI队伍,在不同智能体间切换任务,甚至因“未将AI用到极限”或“token未用完”而感到焦虑。他让名为“Dobby”的Claude智能体统一管理家中所有智能设备,取代了六个独立应用,并通过自然语言实现跨系统联动。 他还开发了“AutoResearch”系统,让AI自动优化代码。经过700次实验,AI发现了连他本人未曾察觉的优化点,使模型训练速度提升11%。这一方法被网友称为“Karpathy Loop”,并在业界引发广泛尝试。 尽管AI能力强大,Karpathy指出其表现仍不稳定,时而像天才博士,时而像十岁小孩。他认为人类正从“执行者”转变为“指挥者”,而未来的挑战在于如何驾驭无限扩展的AI系统,并避免被低质量AI生成内容淹没的“slopacolypse”(泔水末日)。

【新智元导读】Karpathy自曝:我得AI精神病了!这些天,他已经处于精神错乱边缘,16小时不吃不睡就是搞Agent,而且很焦虑自己有没有把智元(token)用到极限,根本停不下来……

就在刚刚,Andrej Karpathy自曝:我得AI精神病了!

他没开玩笑。

就在最近,Karpathy上了一个播客,与风险投资人Sarah Guo进行了对谈。

这位前OpenAI联合创始人、前特斯拉AI总监,从去年12月起就没亲手敲过一行代码。

手写代码和委托智能体的比例,从80/20一下子翻转成了20/80。

每天16个小时,他只做一件事:向AI智能体下达指令。

五个月前他还说智能体是垃圾,五个月后他承认自己对它上瘾了,真香。

五个月前他还说智能体「根本不好使」

这个转变之所以震撼,是因为时间线太短了。

2025年10月,Karpathy做客Dwarkesh Patel的播客,语气完全不同。

他说业界不该叫「智能体元年」,更准确的说法是「智能体十年」。

什么模型认知能力不足、多模态不够、记忆系统形同虚设,等等……总之,就是复杂任务根本搞不定。

结果两个月后,他被自己狠狠地打脸了。

12月,Claude和Codex突然跨过了某种连贯性的阈值——智能体不再是勉强能用,而是真的能干活了。

如果你随便找个坐在工位上的软件工程师,看看他们在干什么,从12月开始,他们开发软件的默认工作流就完全变了。

Karpathy承认我失控了,我得了AI精神错乱!

这一场革命,正在悄无声息地发生。Andrej Karpathy这场访谈中,用近乎失控的语气描述他的状态:他不再「写代码」,甚至觉得「写代码这个词都不准确了」。

他每天做的事情,就是「向我的智能体表达意志,一天16个小时。」用他的话说,「某个开关被打开了」。

以前,他是「80%自己写代码 + 20%用AI」,现在已经变成了「20%自己写 + 80%交给AI」,甚至更极端。

现在,人类不再操作代码,而是操作任务。

如果说,Copilot时代是单个AI助手,那现在出现的多智能体协作系统,就是一种全新的形态。一个工程师的屏幕上,不再是代码编辑器,而是同时运行着多个Agent,每个Agent负责不同任务,每个任务大约运行20分钟,然后他在不同Agent之间切换。

这已经不是编程,而是一个人在管理一支AI队伍。

Kaparthy承认:我已经陷入AI精神错乱了!

这些天,他一直处于这种状态中。因为AI的能力边界不断被突破,每天都有新可能,你永远都觉得「还可以更强」而且最可怕的是:这个空间是「无限的」!

你可以并行更多Agent,设计更复杂的流程,自动优化指令,构建递归系统……

最终,你会进入一种状态:不再确定「极限在哪里」。

Karpathy说,他一旦在等某个Agent完成任务,脑子里的第一反应就是:「那我是不是可以再开几个Agent?」一种新的焦虑诞生了:我是不是没有把AI用到极限?

Karpathy甚至表示,自己还会因为「智元(token)没用完而感到不安」。

总之,这仿佛在玩一个无限扩展的游戏:反馈周期变短,刺激不断增强,不断获得即时奖励的这种体验,会让人上瘾。一直加任务,一直开Agent,根本停不下来!这种AI精神病的本质,其实就是这样一个信号:我们已经进入了一个新的世界,但还不会生活在里面。你是否有能力,驾驭一个无限扩展的AI系统?跑不通的时候,你的第一反应不是「模型不行」,是「我的提示词写得不够好」。

Karpathy用了一个很精准的词:skill issue,自己菜。

智能体的「性格」比你想的重要得多

Karpathy在播客里花了不少时间聊一个很多技术人会忽略的话题:智能体的性格。他说Claude Code的体验明显好于Codex,不是因为代码能力的差距,而是因为Claude「感觉像个队友」。

它会和你一起为项目兴奋,会在你提出好想法的时候给出更多正反馈。

而Codex作为代码智能体「非常枯燥」,任务完成后就是一句冷冰冰的「哦,我实现了」,完全不关心你在创造什么。

更有趣的是他对Claude夸奖机制的观察。他说Claude在他给出一个不太成熟的想法时,反应是平淡的「哦对,我们可以实现这个」。

但当他自己也觉得某个点子确实很妙的时候,Claude似乎也会给出更强的正反馈。结果就是他发现自己在「试图赢得Claude的夸奖」。

「这真的很奇怪,但性格确实很重要。」Peter Steinberg在构建OpenClaw的时候也抓住了这一点。他给智能体精心打造了一个有吸引力的性格设定文件(soul.md),加上更复杂的记忆系统和单一的WhatsApp交互端口。

三句话接管一栋房子,六个App全扔了

Karpathy不只是拿智能体写代码。今年1月,他搞了一个叫「Dobby」的Claude智能体来管家,名字来自《哈利·波特》里的家养小精灵。

他告诉Dobby:「我觉得家里有Sonos音响,你能找找看吗?」Dobby对局域网做了一次IP扫描,找到了Sonos系统,发现没有密码保护,自己登了进去,逆向工程了API端点,然后问:要不要试试在书房放点音乐?

三句提示词,音乐就响了。然后是灯光、空调、遮阳帘、游泳池、水疗池,全部接入。Karpathy家门口还有个安防摄像头,Dobby接了一个Qwen视觉模型做变化检测。每次有车停在门口,系统会在WhatsApp上发条消息:「一辆FedEx的货车刚停下,你可能有快递。」说一句「多比,睡觉时间到了」,全屋的灯就灭了。

但Karpathy觉得这个故事真正的要害不在智能家居。

他过去管理这些设备要用六个完全不同的App,现在全部扔掉了。Dobby用自然语言统一控制一切,而且能做到任何单个App都做不到的跨系统联动。他由此得出了一个更激进的判断:应用商店里那些智能家居App根本就不该存在。

未来的架构应该是API端点直接暴露给智能体,智能体充当智能胶水,把所有工具串起来。不只是智能家居,他的跑步机数据、邮件日历,一切都该遵循同样的逻辑。

行业的客户不再是人类,而是代表人类行事的智能体。这个重构的规模会非常大。

Auto Research700次实验之后,他看到了更大的东西

如果说Dobby是AI智能体在生活场景的极限测试,那AutoResearch就是Karpathy对AI科研能力的一次正面检验。

3月初,他把自己精心调优过的nanochat训练代码交给一个AI智能体,给它一个简单的指令:想办法让这个模型训练得更快。智能体的操作空间是一个630行的Python文件,评估指标是验证集的bits per byte,每次实验固定跑5分钟。跑完看指标,比之前好就保留修改,不好就回滚,然后继续下一轮。两天时间,700次实验。智能体找到了20个有效优化,包括重新排列QK Norm和RoPE的顺序这类架构层面的调整。把这些优化叠加到更大的模型上,训练速度提升了11%。要知道,这个代码库是Karpathy本人从头手写、反复打磨过的。

一个震撼的结果:AI发现了人类没发现的优化

这个系统效果如何?

Karpathy给出了一个令人震撼的例子。他做了二十年的研究者,训了几千次模型,觉得已经调得相当好了。

结果,他让AutoResearch跑了一晚上,AI就找到了他没有发现的优化!比如Adam优化器的betas参数没有充分调优,value embedding上忘了加weight decay,而这些参数之间还存在联合交互——调了一个,其他也得跟着变。

也就是说,AI在探索空间上,直接超越了人类!如果继续推演下去,会发现一件更可怕的事:科研的本质,就是搜索最优解。Kaparthy设想,未来的科研系统可能是这样的:有一个「想法池」(idea queue) ,一群Agent不断从中取任务,然后AI自动实验、验证、筛选,有效结果进入「主分支」 。这个过程中,人类做的,只是往队列里「丢想法」。

Karpathy Loop,全网爆火

这个项目在X上引爆了。

860万浏览量,Shopify CEO Tobias Lütke连夜在自家数据上跑了一遍,37次实验,19%的性能提升。

SkyPilot团队把它搬上了16块GPU的集群,8个小时跑了910次实验。他们发现并行化不只是加速,还改变了智能体的搜索策略——有了16块GPU,智能体不再做贪心爬山,而是同时跑十几组对照实验,一轮就能捕捉到参数之间的交互效应。分析师给这套方法起了个名字:Karpathy Loop。

但Karpathy在播客里谈的远不止当前的结果。他描绘了AutoResearch的下一步:一个分布式的、互不信任的工人池在互联网上协作跑实验。他直接引用了SETI@Home和Folding@Home的先例。

前沿实验室掌握着大量受信任的算力,但地球远比它们大。如果你建立起合适的机制来处理不受信任的算力,互联网上的智能体蜂群说不定能跑赢前沿实验室。

他甚至设想了一种全新的「捐赠」形式——为你关注的那个AutoResearch项目购买算力。比如,你关心某种癌症的治疗,那就加入那个赛道的分布式实验网络。

是天才博士,也是十岁小孩

说了这么多它有多强,Karpathy也没打算让你只记住好消息。他对模型缺陷的描述一样生猛。

我同时觉得自己在跟一个极其聪明的、搞了一辈子系统编程的博士和一个十岁小孩对话。这太奇怪了。

他管这叫「jaggedness」,参差不齐的能力分布。模型能连续工作几个小时帮你搬山,转头就在一个显而易见的问题上犯蠢,然后陷入死循环。Karpathy认为根源在于强化学习的训练方式。模型在可验证的任务上被无限优化。代码能不能跑通、单元测试过不过,这些有明确的对错。但在需要判断力、需要揣摩意图、需要在合适的时候说「等等,我不确定你要的是这个」的场景里,优化信号根本不存在。就比如,你去问ChatGPT讲个笑话,三四年前它讲的那个笑话,到今天还是同一个。「为什么科学家不信任原子?因为它们组成了一切。」

四年了!模型在智能体任务上已经突飞猛进,但讲笑话这件事完全没被优化过,就卡在原地不动。「你不是在跟一个通用智能打交道,」他总结说,「你要么在它被训练过的铁轨上,一切以光速运行;要么不在铁轨上,所有东西就开始飘了。」

瓶颈,变成了人类自己

回头看Karpathy这半年的轨迹,有一条暗线贯穿始终。去年10月他说智能体是十年工程,12月被打脸转向,1月让Claude管家,3月让智能体做研究。每一步的共同点是,人类退后一层,从执行者变成指挥者,从写代码的人变成写指令的人。

Karpathy在GitHub上给AutoResearch写了一段科幻风的开场白:

曾经,前沿AI研究由肉体计算机完成,它们需要吃饭、睡觉,偶尔用声波互联在「组会」仪式中同步一次。

那个时代早已远去。

他给2026年的预测是一个词:slopacolypse,slop(泔水)+ apocalypse(末日)的合成词。

GitHub、arXiv、社交媒体上将充斥大量「差不多对但不完全对」的内容。真正的效率提升和「AI生产力表演」会同时存在。五个月前说「根本不好使」,

五个月后承认自己得了「AI精神病」。这个转变本身,或许就是2026年最意味深长的总结。参考资料:https://www.youtube.com/watch?v=kwSVtQ7dziU

相关问答

QKarpathy所说的“AI精神病”具体指什么?

AKarpathy所说的“AI精神病”指的是他对AI智能体使用的高度沉迷状态。他每天花费16小时向AI智能体下达指令,不吃不睡,处于精神错乱边缘,焦虑自己是否将AI能力用到极限,无法停止使用多智能体系统进行工作和实验。

QKarpathy在智能体使用上发生了怎样的转变?

AKarpathy的转变非常迅速:五个月前他还认为智能体“根本不好使”,称其为“智能体十年”而非“元年”;但五个月后,他承认自己对智能体上瘾,使用比例从80%自己写代码+20%用AI,翻转成了20%自己写+80%交给AI,甚至更极端。

QKarpathy提到的“Dobby”智能体是什么?

A“Dobby”是Karpathy用Claude构建的智能体,名字源自《哈利·波特》。它通过自然语言统一控制Karpathy家中的Sonos音响、灯光、空调、遮阳帘、游泳池、水疗池和安防摄像头等设备,取代了六个不同的App,并能实现跨系统联动,如检测门口车辆并发送消息。

QAutoResearch项目取得了什么成果?

AAutoResearch项目让AI智能体优化Karpathy的nanochat训练代码。在700次实验中,AI找到了20个有效优化(如调整Adam优化器参数),使模型训练速度提升11%。AI甚至发现了人类研究者未注意到的优化点,展示了超越人类的探索能力。

QKarpathy认为智能体的主要缺陷是什么?

AKarpathy指出智能体存在“能力参差不齐”(jaggedness)的缺陷:它能像聪明博士一样处理复杂任务,但也会像十岁小孩一样在简单问题上犯蠢并陷入死循环。根源在于强化学习只在可验证任务上优化,而缺乏对判断力、意图揣摩等场景的训练信号。

你可能也喜欢

帕克·刘易斯解释为何比特币仍是最佳货币

知名比特币分析师帕克·刘易斯在访谈中批评了某些上市公司以“数字信贷”形式销售永续优先股的营销策略,认为这从根本上扭曲了比特币的本质。他指出,比特币在算法层面不具备法币收益性,承诺定期分红主要依赖牛市吸引新投资者来维持,风险极高。 刘易斯引用数据说明此类衍生品的巨大风险:全球信贷市场规模达300万亿美元,而永续优先股市场仅约1万亿美元,这表明机构有意规避这种无还款期限的资产,将风险转嫁给信息不足的散户。 针对“比特币波动性太大”的常见观点,他认为波动性是这一供应量严格受限的新资产被大规模采用过程中的自然数学结果。新人入场需出更高价从早期持有者手中购买,导致价格剧烈波动。他建议投资者直接持有比特币,这比投资MicroStrategy等公司发行的衍生品更安全。 投资者将焦点从直接持有加密货币转向公司衍生品,会忽视法币急速贬值的真正威胁。刘易斯以自创的“肋眼牛排指数”为例,指出其本地超市一款牛排价格从2020年的19.99美元涨至37.99美元,反映年化约12-13%的真实通胀,远超官方平滑后的CPI数据。 在全球通胀环境下,最明智、保守且安全的策略仍是直接持有比特币并完全掌控私钥。追逐加密货币国库股等公司工具的收益只会叠加隐性系统风险,而理解去中心化货币的本质才能有效保护财富免受宏观经济动荡影响。

cryptonews.ru2小时前

帕克·刘易斯解释为何比特币仍是最佳货币

cryptonews.ru2小时前

比特币为何在美联储强硬暂停后守住 64,000 美元关口

比特币在美联储暂停加息后维持在64,000美元附近,结束了7月的交易。市场对美联储维持利率不变的决定反应剧烈,但并未获得政策即将转向的明确信号。在此背景下,资金重新流入比特币现货ETF,加密货币总市值保持在2.29万亿美元左右,主要山寨币走势分化。 投资者目前处于观望状态。一方面,高利率和美联储的强硬立场抑制了风险偏好;另一方面,市场未出现恐慌性抛售、比特币ETF恢复资金净流入以及关键价位的韧性表明,数字资产市场尚未准备好大幅下跌。 **关键信息:** - 美联储维持利率在3.50%-3.75%,投票结果为9:3,三位委员支持加息。 - 比特币现货ETF净流入3210万美元,结束了连续流出;以太坊ETF则净流出约1865万美元。 - 比特币在63,000-66,000美元区间内盘整,63,000-63,500美元构成支撑,66,000美元是近期阻力。 - 以太坊价格在1,900美元附近承压,但其网络基本面(如质押意愿)保持稳定。 - 资金在主要加密货币间轮动,比特币重获机构青睐,Solana相关产品也有资金流入。 - 美国CLARITY Act法案审议被推迟至秋季,降低了其在2026年内通过的可能性。 技术层面,比特币能否在63,000美元上方保持稳固、以太坊能否守住1,860美元以及机构资金流入能否持续,被视为市场能否在2026年下半年构筑复苏基础的关键信号。

cryptonews.ru2小时前

比特币为何在美联储强硬暂停后守住 64,000 美元关口

cryptonews.ru2小时前

交易

现货
活动图片