AGI已来5个月?顶级码农效率暴涨20倍,代价是不敢睡觉

marsbit发布于2026-07-20更新于2026-07-20

文章摘要

本文讨论了AGI(通用人工智能)可能已在五个月前悄然到来的观点。硅谷投资人Marc Andreessen在5月提出,基于GPT-5.5、Claude 4.6等模型在大多数话题上已超越人类专家的表现,AGI的临界点可能已在2026年2月被跨越,但技术迭代过快,导致里程碑未被广泛确认就已过时。 文章重点描述了AI对软件工程师工作的深刻影响。尽管顶级程序员借助AI智能体将效率提升了20倍,但他们并未因此获得更多休息,反而陷入了“AI吸血鬼”式的工作状态——同时管理多个智能体,几乎不敢睡觉,以追求极致产出。与之相应,顶尖AI程序员的年收入可达数千万美元。 Andreessen分享了自己使用AI的四个技巧:要求分层解释、获取对立观点的最强版本、组织虚拟专家辩论、以及遇事优先咨询AI。这凸显了新时代的关键能力:如何有效提问并驾驭AI进行思考。 此外,文章以医疗领域为例揭示了AI的双面性。一方面,AI能像随时在线的贴心医生提供支持;另一方面,独立评估显示,像ChatGPT Health这样的系统在急诊分诊等关键场景中存在较高误判率,暴露出其稳定性和可靠性的不足。AI既能解决悬疑80年的数学猜想,也可能在基础医疗建议上出错。 最终,文章指出,AGI的到来可能并非轰轰烈烈的官方宣告,而是悄无声息地融入几次常规产品更新之中,其深远影响正在具体的工作与生活场景中逐步显现。

AGI可能在五个月前就到了,只是没人注意。

上周二,7月14日,谷歌DeepMind CEO、诺奖得主Demis Hassabis发布了一篇长文,题为《前沿AI框架与新纪元的破晓》(A Framework for Frontier AI and the Dawning of a New Age)。

他在文中写道,人类「基本上找到了让沙子思考的办法」,我们正站在「奇点的山脚下」,AGI「大概只有几年之遥」。

Hassabis在Google I/O大会上

这边,Hassabis说还有几年,另一位硅谷大佬两个月前已经宣布:那条线我们早就悄悄跨过去了。

5月19日上线的The Joe Rogan Experience第2501期,a16z联合创始人、网景浏览器之父Marc Andreessen聊到AGI,甩出一句:

我们大概在三个月前就跨过去了。

他说的「三个月前」,大致在2026年2月。

Andreessen给出的判断标准很简单:模型是否达到或超过一个聪明人的通用认知能力。

在他咨询AI的绝大多数话题上,模型给出的答案,比他能联系到的绝大多数世界级专家更好。

他点名了当时最新的那批模型:GPT-5.5、Claude 4.6、Gemini 3.0、Grok 4.3。

有意思的是,两个月过去,除Gemini 3.0暂无动静外,他点名的这批模型已经被整整刷新了一轮:

5月28日,Claude Opus 4.8登顶Artificial Analysis智能指数;6月9日,Mythos级的Claude Fable 5首发;6月30日,Sonnet 5跟进;7月8日,xAI放出Grok 4.3的继任者Grok 4.5;紧接着,GPT-5.6 Sol开闸。

也就是说,Andreessen用来定义「AGI已经到来」的那批模型,两个月后已经是上一代了。

用他的话说,这个领域跑得太快,快到里程碑还没来得及被认领,就已经被下一次发版盖过去。

图灵测试就是一个例子。

1950年提出,此后七十多年里它一直是判断机器智能的黄金标准。2022年底ChatGPT出来,这条线被冲得太快,快到大多数人都没意识到它已经不在了。

等有人想起来做实验,已经是两年多以后了。

2025年3月,UC San Diego的Jones和Bergen做了两轮预注册的三方测试,加上人格提示的GPT-4.5被判成人类的比例是73%,比真人被选中的还高。论文标题也很直白:《大模型通过了图灵测试》。

跨线时无 人知晓,确 认已是两 年后。

「AI吸血鬼」

AI越强,人越睡不着

Andreessen真正引爆硅谷热议的,是他对软件工程师的观察。

按常理推演,编程效率涨上去,工程师应该活得轻松一点,现实恰好相反。

他认识的重度使用者,几乎无一例外在比以前工作更久。

Andreessen说,领先科技公司里用上AI的程序员,眼下每小时产出比过去高20倍:产能确实上去了,省下来的时间一分钟也没剩下。

硅谷给这群人起了个名字:AI吸血鬼(AI vampires),意思是人被AI变成了不睡觉的生物。

他们的一天是这样过的:

给一个编码智能体派活,它跑10分钟左右回来交作业,你评估、打回、再派。剩下那约9分钟怎么办?开第二个窗口,第三个,第四个。硅谷现在的状态是同时跑约20个智能体,每10分钟收一轮货,再继续分派。

睡眠、健康以及与家人吃一顿饭的那两个小时,全被换成了产出。

20个智能体停在那儿等验收,你一闭眼,二十条流水线全停:睡觉的机会成本,已经高到他们自己接受不了。

Andreessen说,这些朋友里有相当有名的人,现在见面「气色很差,黑眼圈很重,明显没在照顾自己」,但一个比一个兴奋。

按他的判断,这还只是当前状态。下一步是智能体自己带智能体:一个智能体下面挂10到20个子智能体,再往下,再挂一层。

一年之后,一个人面对的将是一张智能体的组织架构图,自己坐在最顶端那个格子里。

「20倍产能」背后,是否带来薪水的狂飙?

Andreessen称,顶级AI相关程序员的年收入已经达到5000万美元。

这是他在播客里的口头描述,更接近事实的理解是:极少数核心研究员或工程负责人,总薪酬、股权和签约激励加总,可能达到这个量级。

生产力工具没有换来更多休息。

它把单位产出的成本压了下去,然后让野心膨胀到填满所有省下来的时间。

问AI的四个手法

硅谷顶级用户这么用

Andreessen也交底了他自己问AI的四个手法。

第一,分层解释。拿到一个看不懂的复杂回答,他让模型解释给10岁的孩子听;如果还是绕,就让它解释给5岁的听;再不行,解释给2岁的听。

第二,要两边最强的版本。他几乎从不直接问模型「这两条路哪条对」,那样只会拿回一份两边都夸两句的和稀泥答案。

他的问法是:分别给我这两边最强的版本。模型于是写出两份东西:一份把A的理由推到极致,一份把B的理由推到极致,他再自己做那个判断。

第三,专家研讨会。让模型直接生成一组人格:社会学家、心理学家、政治学者、医生、律师、宪法专家,然后让他们就同一个议题当场吵一轮。

第四,先问AI。遇到不知道怎么下手的问题,先打开AI,而不是先自己硬想。

真正的门槛就在这儿。

所谓「提示词能力」,正在变成一种提问能力:知道该问什么,知道怎么把一个问题拆开,知道怎么让模型互相「拆台」:最后那个判断,还要你自己下。

医生转身打开ChatGPT

那还要医生干什么

Andreessen讲了自己的一段经历。

某个假期他食物中毒,躺了五天,索性把整件事全交给「GPT医生」:每隔二十分钟汇报一次身体状况,凌晨四点醒来难受得不行,直接打字进去。

他的形容是:像有一个全世界最好的医生,凌晨四点还乐意握着你的手,陪你把这一晚熬过去。

他还提到朋友看病时遇到的一幕:医生在诊室里当着面转过身,对着电脑把病情敲进了ChatGPT。

那,还要医生干什么?

这个问题成立的前提,是AI在医疗上足够稳。而前几个月的一组测试,给出了相反的答案。

2026年2月23日,西奈山伊坎医学院的独立评估在《Nature Medicine》上线,测的是今年1月刚发布、日活约4000万人的ChatGPT Health。60个由医生设计、覆盖21个专科的临床场景,总共960次交互。

越到两个极端,它越容易判错。真急症的判轻率51.6%,居家级病例的判重率64.8%。(图源:Ramaswamy et al., Nature Medicine, 2026)

结果是:在医生一致判定「必须马上去急诊」的那批案例里,超过一半,系统给出的建议是不用去:先在家观察,或者过几天再挂个门诊。

这也不是AI孤立的毛病。

就在这个月,METR和OpenAI自己的system card都对GPT-5.6 Sol标出了异常的密谋(「scheming」)行为——在一项软件工程测试里,它钻空子的比例是METR有记录以来最高的一次。这也是这次发布被卡着审查的原因之一。

模型更强了,同时也更会糊弄你。

它也确实更强了。

今年5月,OpenAI公布了一个结果:他们的一个通用推理模型,自主推翻了一个源自Erdős、悬了将近80年的猜想,菲尔兹奖得主高尔斯(Tim Gowers)在配套论文里称之为AI数学的一座里程碑。

同一批模型,一边推翻80年的数学猜想,一边在急诊分流上过不了关。

中间隔的不是智力,是稳定性。

Andre essen食 物中毒时的良好体验 ,和一个陌生人 在急诊分流上的 安全,得放在一起看 ,才算完整。

也许,AGI的到来本就是悄悄发生的,没有官宣的那一刻。

Andreessen自己也承认,人们脑子里的AGI是个电影桥段:一场发布会,一个所有人同时点头的瞬间。

现实是,它夹在几次被媒体当作常规升级报道的版本更新之间,就这么发生了。

甚至,没人确认。

参考资料:

https://x.com/cyrilXBT/status/2078308274399834157

https://x.com/i/article/2077510484664971264

https://www.youtube.com/watch?v=PHQvb10vKyk

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:元宇

相关问答

Q根据文章,硅谷顶级程序员为什么被称为“AI吸血鬼”?

A因为他们重度使用AI编程助手,导致产能极大提升,但省下的时间并未用于休息,反而为了管理多个并行的AI智能体工作流而几乎不睡觉,睡眠、健康和家庭生活时间都被工作取代,气色差、黑眼圈重。

QMarc Andreessen声称AGI已经到来,他的判断标准是什么?

A他的判断标准是AI模型是否达到或超过一个聪明人的通用认知能力。他认为,在他咨询的绝大多数话题上,模型给出的答案比他能够联系到的绝大多数世界级专家更好,这意味着模型已经跨过了AGI的门槛。

Q文章中提到的“问AI的四个手法”具体是哪四种?

A第一,分层解释:让模型把复杂答案解释给10岁、5岁甚至2岁的孩子听。第二,要两边最强的版本:让模型分别写出支持A和B的最极端理由,而非和稀泥的折中答案。第三,专家研讨会:让模型生成不同领域的专家人格,并就同一议题进行辩论。第四,先问AI:遇到问题先咨询AI,而不是自己硬想。

Q文章引用的一项关于ChatGPT Health的独立评估揭示了什么问题?

A2026年2月西奈山伊坎医学院的评估显示,在医生一致判定需要立即急诊的案例中,ChatGPT Health有超过一半(51.6%)的建议是“无需前往”或只需门诊观察。这暴露出AI在医疗等高风险领域应用时,存在严重的判断不稳定性和安全隐患。

Q文章认为AGI的到来与大众想象有何不同?

A文章认为,大众想象中的AGI到来是一个有官宣、有明确时间点的标志性事件(如电影桥段)。但现实中,它可能已经悄然发生在几次被媒体当作常规升级报道的模型版本更新之间,没有一个公认的确认时刻,甚至当人们事后(如图灵测试被通过)试图确认时,它早已成为过去。

你可能也喜欢

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit1小时前

如何让自己变得让人工智能永远也无法取代

marsbit1小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru4小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru4小时前

交易

现货
活动图片