他亲手造出o1和o3,却突然宣布:人类可以永远退休了

marsbit發佈於 2026-08-27更新於 2026-08-27

文章摘要

前OpenAI核心研究员Jerry Tworek(曾主导o1、o3推理模型)近日提出惊人观点:人类AI研究员的工作可能在两年内被AI取代。他认为,目前AI研究已分为“出主意”和“执行”两部分,而执行环节已基本由AI Agent接管,实验周期从一个月缩短至一天。真正能主导前沿模型研发的全球仅约30-50人,其余均为辅助角色。 Tworek指出,Transformer架构很可能并非最优解,其无法在部署后持续学习、存在灾难性遗忘等问题。但在OpenAI的七年中,认真尝试替换底层架构仅有三四次,因创新需巨大算力与高层支持。他回忆,正是首席科学家Jakub Pachocki给予的算力信任,才让强化学习突破瓶颈,催生了o1。 如今,他创立的Core Automation公司用AI Agent执行高难度编程任务,例如用十万美元成本将某GPU内核性能提升60倍,相当于替代了稀缺专家。这意味着,连最核心的架构创新也可能被自动化。 面对“人类还能做什么”的提问,Tworek描绘了两种后AGI时代图景:一是如古希腊人般自由探讨哲学、锻炼身心;二是像运动员一样,为追求“卓越”而持续学习。他强调,“世界必须靠我们工作才能运转”本身是个伪命题。 尽管加速自动化会取代包括他自己在内的顶尖研究者,Tworek仍全力推进。他用公司内部的口头禅回应质疑:“一切都是skill issue(技术问题)”。对于当前AI研究员间流行的“最后几天班”的黑色幽默,他认为其中混杂着兴奋与悲凉,但这段剧烈变革的职业生涯“极其值得”。

哎,听说了吗?

人类研究员的好日子,满打满算也就剩两年了。

两年之后,人类搞AI研究,就跟今天人类下国际象棋一样。

你当然还能下,但压根没人在乎你下得怎么样。

这是前OpenAI推理模型一号位Jerry Tworek抛出的最新暴论。

他2019年进的OpenAI,一待就是七年。当年强化学习死活scale不动,是他死死咬住不放硬推上去的,o1和o3这两代大杀器都是他亲自带队砸出来的。

「我们想造AGI。」这是2019年他刚进OpenAI时,Ilya在全员会上给出的全部路线图。七年后,他自己出来单干了

更瘆人的是,这话不是他一个人在说。现在AI研究员之间最流行的一句内部梗是这样的——

咱们只剩最后几天班可上了,趁着现在还能干就赶紧干,干完就集体退休休息去吧。

大伙儿都把这当黑色幽默来回讲。可每个讲笑话的人心里都跟明镜似的。

这玩笑,八成就是现实。

而这还只是开胃菜。整场访谈里,这种狠话他一句接一句:

  • Agent确实有创造力,可那是一种极其劣质、海量堆砌的创造力,想法五花八门,也普遍烂得可以
  • 全世界真正把一个前沿模型从训练摸到部署的人,可能也就三十到五十个,剩下所有人都在给他们打下手
  • 把Transformer当成最优解,这个假设几乎不可能成立
  • 在OpenAI待的那七年里,真正认真尝试换掉底层架构的次数,只有三到四次
  • 世界非得靠我们上班才转得动,这个前提本来就不成立

以下是整理后的版本,Enjoy。

一半的活,已经没人干了

两年这个数字,跟跑分没关系,跟算力也没关系。

他数的是研究这件事里,还剩多少活是人在干。

而这活儿早就被劈成了两段。

一段是出主意,想清楚该往哪儿走。另一段是干活,把想法变成能跑的代码再把数据拿回来。

而干活那一段,已经基本归Agent了。

Tworek今年4月开了家叫Core Automation的公司,口号是造全世界最自动化的AI实验室。

在他们那儿,一次实验的完整周期,直接从一个月压到了一天。效率整整提升了三十倍!

不过出主意这一段,Agent暂时还接不了。原因在于——

它们绝对属于高创造力的物种。

但它们是以一种极其劣质、海量堆砌的方式在挥霍创造力。想法确实五花八门,但想法也普遍烂得可以。

全世界就三十到五十个人

这么听着,出主意这一段好像还稳。

可真正能出主意的人,本来也没剩下几个。

在采访中主持人透露,有位OpenAI内部研究员跟他交过底——

全世界真正能端到端把一个前沿模型怎么训、怎么部署搞明白的人,可能也就三十到五十个。

剩下所有人都在给这几十个大脑打下手,包括那家最牛公司里的绝大多数正式员工。

Tworek没有反驳。

他也觉得,任何顶级团队都是这么转的。少数几个人定下航向,身后拖着一整台轰鸣的执行机器。

要知道,这几十个人到底有多抢手,看他自己的招人名单就够了。

Core Automation的联合创始人Rohan Anil,来自Anthropic,更早在Google DeepMind。

在DeepMind做过Gemini的Anmol Gulati也被挖了过来。连OpenAI原来的人力负责人Julia Villagra都跟着过去了。

所有实验室都在同一个池子里捞人。而这个池子,一共就那么几十条鱼。

所以两年这个数字,跟全人类没什么关系。

说的是这几十个人,还能再撑多久。

七年,架构只被认真动过三四次

既然人只剩几十个,那挡在AI面前的最后一道墙是什么?

Tworek的答案只有一个词,Transformer。

在他看来,这东西几乎不可能是最优解。

首先,模型没法在部署之后继续学。你跟它聊得再多,它也不会变强,下一轮对话还是原来那个它。上下文窗口也撑不住,他说自己用Codex干上二十来分钟,就得压缩一次。

其次,如果想靠持续微调去补,就会发现不仅效率极低,而且会灾难性遗忘,学会了新的就忘了旧的。

所以这几年整个行业围着Transformer做的大部分活,其实是在把它变便宜,很少有人真的在把它变强。

而Tworek真正想要的东西,其实也不在架构本身。

他要的是能在test time继续学习的模型,是那种能从用户交互、从用户数据里一直往下长的模型。换架构只是通向那个东西的手段。

这些道理业内没人不懂。可这么多年过去,为什么Transformer还稳稳立在那儿?

背后的原因简单得有点荒唐——压根就没怎么试过。

在OpenAI的七年里,真正认真尝试替换底层架构的次数,只有三到四次。

流程是这样的。

研究员先写一个小规模验证实验,写完至少跑三个月。结果看着顺眼,才敢放大。

而所谓放大,就是你得凭三寸不烂之舌说服差不多十个掌握生杀大权的人,然后这十个人再把三到六个月砸进你这个无底洞。

最后要么被Transformer早就滚成雪球的那股动能碾碎,要么被部分吸收,变成它身上的一个螺丝钉。

七年,三四次。这就是全世界最强的AI实验室,在架构创新上的全部产能。

「Jare,这些算力拿去烧」

他自己就在OpenAI撞过一次一模一样的死局。而撬开它的,是一句话。

当时那批半死不活的实验,挣扎出了那么一点「生命迹象」。谈不上好,但总算是有了苗头。

就在这个节骨眼上,后来坐上OpenAI首席科学家位子的Jakub Pachocki找到了他。

「Jare,这些GPU统统给你,你看看能不能把手上的结果搞得再大一点、再狠一点。」

「现在你手里有这些GPU了。」他复述这句话的时候,o1还没有名字

这句话把他从一个悖论里捞了出来——

你必须先拿出结果,才有资格要算力。

可你明明得先有那笔算力,才砸得出结果。

Tworek说,大部分前沿方向都困在这个悖论里。实验室里为抢算力打得头破血流的暗战,说到底都是在找一条出去的路。

而出口,有时候就是领导层那么一 点点 信心。

只要有人从上面发话,说我希望你能有一笔像样的算力配额去狠狠搞它。这就足够了。

闸一开,后面就收不住了。

强化学习从这个节点开始,跨过了好几个数量级。

然后o1的破茧而出,推理模型这条被无数人判过死刑的路,硬是被他走活了。

十万美元,顶一个专家

而这一次,他不用再等谁发话了。

整条链上最烧钱的环节,就是把抽象的想法翻译成能真跑起来的代码。而这恰恰正是如今的Agent干得最漂亮的活计。

比如Core Automation就曾拿这套打法去啃过GPU的内核。

具体来说,他们把一个QR分解内核丢给编程Agent跑了四周,烧掉大约十万美元的调用成本,最后把这个内核的速度推到了原来的六十倍。

这活儿属于底层性能工程,抠的是一段矩阵运算在显卡上怎么跑得更快,平时得靠极少数专家一行一行手调。

而这样的专家,全世界也没几个。

现在十万美元就能顶上一个。它既不用被说服,也不需要三到六个月。

卡了七年的那道关口,就这么被冲开了。

那以后我们还能干嘛?

连最难啃的架构都松动了,那几十个人手里的方向盘,也就握不了多久。

访谈最后,主持人把这件事挑明了问他,等这一天真的到了,人还剩下什么可干的。

对此,Tworek描述了两幅画面。

第一张是古希腊。

大伙儿在广场上碰个头,慢条斯理聊上一整天哲学,然后跑去锻炼身体,吃着橄榄,喝着葡萄酒。

他自己刚描绘完就笑了,承认这大概只是在投射他本人的愿望。

「我们在广场上碰个头,然后聊天。」他描述后AGI时代人类日常的原话,说完自己先笑了

第二张是高中,或者说大学。

他觉得人应该保留一种对「卓越」本身的追求。继续贪婪地学新东西,把身体和脑子都往死里练。

这有点像职业体育,没有任何经济上的理由非逼着你去流血流汗,可人骨子里的骄傲,就是要去够一够那个叫「伟大」的东西。

我们得找到各种方式去干这件事。

因为在下一个世界里,不会再有那种「你不做,这世界就要塌了」的事情。世界会自己在我们已经建好的基础设施上跑下去。

「我们应该一直学下去。」他把这件事说得像是一种义务,而不是消遣

然后他平静地掀开了底牌。

我们必须工作,这个世界才能运转。这个假设,根本没必要成立。

「很多人的自我价值来自工作。」他承认这是最难迈过去的一关,包括对他自己

他自己也在这张名单上

说实话,听完整场,最让人心里发毛的不是那个两年。

是他自己也知道,他正在给这个倒计时踩油门。

他要造的那个东西,定义就是能自己学、自己变强,再也不用人守在旁边投喂。造成了,那几十个人的位置消失得更快。

而他还有一句更狠的,第一个判的就是他自己。

如果你不是那个算力储备最恐怖、体量最大的实验室,你就会死得很难看。

说这话的时候,Core Automation才成立四个月,账面收入是零。

他说自打创业以来,几乎每个星期都有人跑来跟他讲,Jare,太晚了,那把通天的梯子早就被收上去了。

他的回应只有一句自家口头禅。

我们公司的人最爱说,一切都是skill issue。

翻译过来就是,失败到最后别怪大环境,全怪你自己技术太菜。

你别说,这话放在这场访谈里,还真有点那个味道。

再回头看开头那句流行梗。

咱们只剩最后几天班可上了,趁着现在还能干就赶紧干。

那语气里到底是兴奋,还是悲凉?我们无从得知。

因为对说这话的人来说,那两种情绪本来就是一回事。

Tworek说,这一行的节奏极度消耗人,这么多年干下来,真的是非常非常累。

「但如果我们真的相信,这是我们整个职业生涯里最重要的一段时间。」

「那大概,是极其值得的吧。」

参考资料:

https://x.com/MTSlive/status/2092387349623935322

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西

相關問答

Q前OpenAI研究员Jerry Tworek对于AI研究领域的人类工作时间给出了怎样的预测?

AJerry Tworek预测,人类研究员在AI研究领域的好日子,满打满算只剩大约两年时间。两年之后,人类从事AI研究将类似于今天人类下国际象棋的地位——虽然还能做,但已经无人关注其水平如何。

Q根据文章,目前在全球范围内,真正有能力端到端地训练和部署前沿AI模型的人有多少?

A根据文章透露,一位OpenAI内部研究员表示,全世界真正能端到端地从头训练并部署一个前沿AI模型的人,可能只有大约三十到五十个。其余的所有研究人员,包括顶尖公司里的大多数正式员工,都在为这几十个人提供支持。

Q文章中提到当前AI模型的核心架构Transformer存在哪些主要缺陷?

A文章指出,Transformer架构存在几个主要缺陷:首先,模型在部署后无法继续学习,对话互动再多也不会让它变强;其次,上下文窗口容量有限,长时间使用后需要压缩;再者,持续微调不仅效率低下,还会导致灾难性遗忘,即学会新知识就忘了旧知识。整个行业目前主要是在努力降低Transformer的成本,而非大幅提升其能力。

QJerry Tworek所创办的Core Automation公司,在解决研究难题方面展示了一个什么具体例子?

ACore Automation展示的例子是,他们曾将一段QR分解(一种矩阵运算)的GPU内核优化工作交给编程Agent执行。在花费了大约十万美元的计算调用成本、持续运行四周后,Agent成功将该内核的运行速度提升到了原来的六十倍。这原本是需要全球极少数的底层性能工程专家手动一行行调整的高难度工作。

Q对于在AI可能实现自主进化后的人类未来,Jerry Tworek描绘了怎样的图景?

AJerry Tworek描绘了两种可能的未来图景:第一种是类似古希腊的生活,人们在广场上悠闲地交谈、锻炼身体、享受生活;第二种是类似高中或大学的状态,人们出于对“卓越”和“伟大”的内在追求,继续贪婪地学习新事物、锻炼身心,就像职业运动员一样。他最终的核心观点是:世界并非必须依赖人类工作才能运转,这个前提假设本身就不成立。

你可能也喜歡

长江存储,是第二个长鑫吗?

科创板即将迎来史上最大IPO。长江存储的上市申请已获受理,拟募资330亿元,超越此前长鑫科技的295亿元,创下科创板募资规模纪录。 同为国产存储龙头,两家公司均成立于2016年,采用IDM模式且无实控人,但核心业务与技术路线截然不同。长鑫科技主攻DRAM(运行内存),而长江存储聚焦NAND Flash(闪存),用于长期数据存储。市场方面,DRAM全球市场规模约为NAND Flash的2.3倍,且前者由三星、SK海力士、美光高度垄断,长鑫作为全球第四大、国内唯一的DRAM IDM企业,享有打破垄断的稀缺溢价。长江存储虽然在2026年第二季度NAND出货量份额跃居全球第三,但因产品集中于消费级领域,高附加值的企业级SSD占比低,其营收排名仅列第五。 长鑫科技上市首日市值暴涨超5倍,但专家认为长江存储难以复制此神话。当前存储板块已从高点回调,市场风险偏好下降。尽管长江存储2026年一季度业绩亮眼,营收和利润表现优异,但TrendForce报告指出,NAND Flash市场因新产能释放和消费需求走弱,未来价格可能承压。专家指出,长江存储在AI产业链中的战略价值不及主攻DRAM和HBM的长鑫科技。其上市表现将高度依赖发行定价是否合理:若定价激进可能面临破发压力;若留有安全边际,则可能获得理性资金认可。长远来看,公司市值最终取决于其业绩表现及能否在HBM等关键技术领域取得突破。

marsbit25 分鐘前

长江存储,是第二个长鑫吗?

marsbit25 分鐘前

交易

現貨
活动图片