奥特曼点名:他才是AI界最重要的研究者,但几乎没人知道他

marsbit发布于2026-08-17更新于2026-08-17

文章摘要

奥特曼在访谈中称Alec Radford为“AI历史上最重要、却不太为人所知的研究者”,并视其为OpenAI崛起的幕后功臣。Radford是GPT-1、GPT-2、CLIP、Whisper等里程碑论文的第一作者,并参与了GPT-3、DALL·E、Scaling Law等关键工作。他在2016年加入OpenAI后,主导了早期语言模型探索,其“无监督情感神经元”实验揭示了模型通过预测任务可自发学习新能力。他率先将Transformer架构用于生成式预训练,催生了GPT系列,为OpenAI确立了核心发展方向。 Radford的研究直觉始终如一:为模型设计足够通用的训练任务,提供充足的数据与算力,通用能力便会自行涌现。这一理念不仅贯穿于语言模型,也体现在其跨模态工作中,如DCGAN、Image GPT、CLIP和Whisper,他总能领先行业一步,找到下一个值得规模化的简单任务。 尽管成就卓著,Radford极为低调,几乎不经营个人品牌,很少接受采访。2024年底他离开OpenAI从事独立研究,近期推出的“Talkie”项目却一反行业潮流:这是一个仅用1931年前文本训练的“古董”模型,旨在探索模型在未见过的领域(如现代编程)中快速学习新技能的能力,而非依赖海量数据记忆。这再次体现了他前瞻性的思考方式:当外界还在追逐规模时,他已转向探究人工智能的学习本质。

最新访谈中,奥特曼给出了一个罕见的评价:

「他可能是AI历史上最重要、却不太为人所知的研究者。」

这个人就是Alec Radford,真·GPT之父。

你可能没听过他,但你大概率用过他发明的东西。

GPT-1、GPT-2、CLIP、Whisper,他都是论文第一作者。

此外,他还参与了GPT-3、DALL·E、Scaling Law、GPT-4和GPT-4o等一系列关键工作。

奇怪的是,这样一个履历几乎横跨大模型每次关键转向的人,没有博士学位,也很少接受采访。

ChatGPT红遍全球时,聚光灯下几乎看不到他的身影。

但如果顺着过去十年的AI论文往回翻,会发现一个更奇怪的现象:

每当模型开始获得一种此前没有的通用能力,Alec Radford的名字,往往已经提前出现在作者栏里

OpenAI真正起飞,从招进Alec开始

最新一期《Invest Like The Best》节目中,主持人问奥特曼:

「这家公司一路走来,你最欣赏的幕后功臣是谁?」

奥特曼脱口而出,是Alec Radford

Alec做出的工作,后来真正演变成了GPT系列。

除此之外,他还不断启发、引导身边的人,把研究推向一些后来被证明极为重要的方向。

《连线》也同样给过一个分量极重的判断:

OpenAI的崛起之路,真正始于它聘用了当时还默默无闻的Alec Radford。

2016年,Alec加入OpenAI。那年他只有23岁。

那时,他还是个半夜吃菠萝洋葱披萨、和同学一起打Kaggle比赛的毛头小子,在波士顿的宿舍里创办了一家小型AI公司:Indico

接受邀请加入OpenAI后,Alec也没觉得多重要,反而感觉这份工作「有点像读研究生」。

没有太多短期压力,也没有必须立即做成的产品。他可以自由寻找一个当时还没人知道答案的问题:语言模型究竟能干什么?

他的第一次尝试,是拿20亿条Reddit评论训练语言模型。数据规模不小,结果却没什么用。

这个实验和OpenAI早期的许多探索一样,失败了。

但OpenAI让他继续做下去,时任CTO的Greg Brockman回忆:

「我们当时就觉得,Alec很厉害,就让他做他想做的事吧。」

于是,这个年轻人得以继续尝试他的实验。但很快,他就受限于OpenAI的算力不足。

既然跑不起更大的实验,Alec便把范围缩小,找来大约1亿条亚马逊商品评论,让模型做一件简单到近乎乏味的事:根据前面的文字,预测下一个字符

这个过程中,一个意外出现了。

虽然没有人教模型什么叫好评、什么叫差评,但模型内部有一个神经元,开始主动区分评论的正负情绪。

把它调向一个方向,模型更容易生成好评;调向另一个方向,它便开始吐槽商品。

OpenAI后来把它叫作「无监督情感神经元」

这次实验第一次给出了Alec真正想找的答案:

当模型被要求在足够多的数据上完成预测任务时,它可能自行学会一些训练目标里从未明确写出的能力。

Ilya Sutskever还鼓励他跳出亚马逊评论,让模型去学习规模更大、内容更多样的文本,甚至是整个互联网。

问题是,以当时的神经网络架构,处理如此庞大的数据可能需要数年。

但很快,OpenAI迎来了好运。因为在2017年,谷歌那篇改写AI进程的论文《Attention Is All You Need》,横空出世。

Ilya一眼就看中了Transformer架构。他的第一反应是:「这正是我们一直在等的东西!」

Alec随即把Transformer接到此前的实验路线上。他找来BooksCorpus数据集,其中包括7000多本尚未正式出版的英文书籍,题材横跨爱情、冒险和奇幻。

与许多句子被打散的数据集相比,书籍保留了长篇连续叙事,更适合让模型学习前后文之间的远距离关系。

他并没有像谷歌那样用Transformer做机器翻译,而是让它预测下一个最可能出现的词。

机器有了反应:一个词,接着一个词,再一个词——每个新词都是从那七千本书中隐藏的模式推断出来的。

对Alec来说,「这两周内取得的进展,比过去两年加起来都多」。这套实验最终成为GPT-1的预训练基础。

他与同事开始谈论一个叫「Big Transformer」的方向:不要给模型设计更多精巧规则,直接把模型、数据和计算规模做大,看看它还能学出什么。

2018年,这条路线有了正式名字:

Generative Pre-trained Transformer(生成式预训练Transformer),简称GPT

第一篇GPT论文共有四位作者,排在第一位的,就是Alec Radford。

GPT-1没有立即轰动世界,但它给OpenAI带来了一样更重要的东西:方向。

Alec取得突破后,OpenAI管理层作出了一系列关键决定。他们开始把研究资源从机器人等分散项目中收拢,集中到语言模型。

比起继续设计复杂的新结构,团队更愿意收集更多数据、投入更多算力,把已经显示出潜力的方法继续放大。

一年后,GPT-2发布。

它的参数量从GPT-1的1.17亿增加到15亿,训练数据也从7000多本书扩展到约800万个网页。

GPT-2论文共有6位作者,Alec仍然排在第一位,并与Jeffrey Wu为共同一作。

这一次,模型不再需要针对每项任务重新训练。只靠预测下一个词,它已经能尝试翻译、问答和摘要,甚至在多个零样本测试中取得不错的成绩。

2020年初,OpenAI把这种关系写进《神经语言模型的Scaling Laws》论文。

Alec同样在10位作者之列。此前依靠一次次实验积累的判断,开始被描述成可以预测的数学规律。

同年5月,OpenAI把模型进一步放大到1750亿参数,做出了GPT-3

此时,论文作者已经从GPT-1的4人增加到31人。

第一作者变成Tom Brown,Alec排在第29位,仅位于Ilya Sutskever和Dario Amodei之前。

署名位置的变化,也暗示了GPT项目性质的改变。

它不再是Alec主导的少数人实验,而是OpenAI调动研究、工程和算力共同完成的大型项目。

Alec最早推动的路线,已经变成这家公司最重要的技术战略。

但就在GPT真正开始为外界熟知、即将产生巨大影响的时候,Alec却已经把目光移向了别处。

语言之外,他又连续押中图像和语音

GPT-3发布后,Alec做回了他的老本行:图像。

早在加入OpenAI之前,他最有影响力的作品就是DCGAN

他与Luke Metz、Soumith Chintala把卷积网络引入GAN,解决了这类模型难以稳定训练的问题。

他们还发现,模型在学习生成卧室图片时,会自行形成关于床、窗户和场景结构的视觉表征。

后来反复出现在Alec研究中的那种直觉,此时已经露出雏形:

只要找到一个足够通用的训练任务,模型可能在完成任务的过程中,自己学出更多能力

其实吧,这中间还有个八卦。

2016年,黄仁勋在英伟达大会上展示DCGAN生成的图像,却把主要功劳归给了Yann LeCun当时领导的Facebook实验室。

Alec和几位同伴坐在波士顿办公室里看直播,非常受伤。

不久后,Alec就离开波士顿,加入OpenAI。

他的朋友Victoroff甚至认为,这次被忽视是Alec决定前往OpenAI的重要原因之一。

几年后,他带着GPT重新回到图像。

2020年,OpenAI发布Image GPT:把图片展开成一串像素,再像预测下一个词一样,预测下一个像素。

Alec排在论文作者第二位。

它证明,GPT并不天然属于语言。只要数据能够被表示成序列,同一套方法也可以用来学习图像。

只是逐个生成像素实在太慢。半年后,DALL·E把图片压缩成视觉Token,再将文字和图像放进同一条Transformer序列。

「牛油果形状的扶手椅」「遛狗的萝卜宝宝」,这些从未存在的组合第一次被模型画了出来。

与DALL·E同一天发布的,还有CLIP

这一次,Alec重新回到共同第一作者的位置。

OpenAI拿出从互联网收集的4亿组图文对,让模型只做一道选择题:哪段文字和哪张图片是一对?

没有固定类别,也没有为每项任务专门训练。

最终,CLIP在没有使用ImageNet训练集的情况下,零样本识别准确率已经与早期有监督训练的ResNet-50相当。

图像之外,他也在尝试声音。

2020年的Jukebox把音频压缩成离散编码,再让Transformer像生成文字一样生成音乐。

两年后,同一条路线通向了更实用的Whisper

Alec又排在论文作者第一位。

OpenAI从互联网上收集了68万小时音频及其文本,数据并不完美,却包含不同语言、口音、噪声和使用场景。

Whisper没有专门针对某一张榜单优化,在多个不同来源的数据集上进行零样本测试时,它却表现得更加稳健,更能应对真实世界里的口音、背景噪声和专业词汇。

这些工作表面横跨图像、语言、多模态和语音,背后却源自Alec的同一个判断:

少规定一些规则,多提供一些数据和算力,通用能力可能自己出现。

他似乎总能比行业共识早一步,找到下一个值得放大的简单任务。

OpenAI最神秘的男人

大佬的辉煌过往,不胜枚举,介绍到这里就结束了。

回到他本人,几乎可以说「曾是」OpenAI最神秘的男人。

与他的论文影响力相比,Alec几乎不经营个人品牌。

虽然有X账号,坐拥7万粉,但他很少围绕自己发东西,大多是转发。

上面置顶的,至今还是2018年发布GPT-1时的那条消息。

「这是我过去一年一直在做的事情。」

他先列出CoVe、ELMo和ULMFiT三项启发来源,然后用一句颇为朴素的话介绍成果:

「一个Transformer语言模型,只需少量调整,就能被迁移到各种自然语言处理任务。」

谁能想到,这项工作预告了一个全新的时代?

关于Alec的公开长篇采访,寥寥无几;而他的个人网站,也简单得近乎空白。

只有姓名、「Latest Posts」和分页按钮,几乎没有其他内容。

(连照片都一直用同一张,大佬实在太低调了)

这与他的行业地位形成了一种奇怪的反差。

公众谈起OpenAI和GPT,最先想到的是奥特曼和Ilya Sutskever;但研究者谈起过去十年的关键论文,却很难绕过Alec Radford。

奥特曼在最新访谈中形容,如果去问那些与Alec共事过的人,他们当然会先说:

这是一个「几十年一遇的天才」、极具创造力的思考者,对自己的研究有极深的理解。

但话说完之前,每个人都会补上另一句:

他也是他们合作过的最善良、最好的人之一。

One More Thing

不过,这位评价超高的GPT之父,在科研上确实挺不走寻常路的...

2024年12月,Alec离开工作近九年的OpenAI,从事独立研究。

但当所有人都期待他做出下一个GPT的时候——

Alec跑去搞了个「老头AI」。

今年4月,他和Nick Levine、David Duvenaud共同推出Talkie

这是一个拥有130亿参数的「古董语言模型」,基础模型使用2600亿个Token训练。

它的预训练语料有一条硬规矩:

1931年1月1日之后出版的英文材料,统统不!准!进!

所以,它读过蒸汽机、飞机和第一次世界大战,却不知道电视机、互联网和第二次世界大战后来发生了什么。

更不可能知道Python。

但就这么个老古董,研究人员给它看了几个Python程序示例,再让它解决HumanEval编程题。

它居然真的写出了几段简单代码。

这个实验真正测试的是:一个从未接触现代计算机的语言模型底座,获得少量新示例和后训练后,能以多快的速度吸收一项完全陌生的技能?

啥?你是说当全网都还在猛猛Scaling、想办法让模型读得更多的时候...

GPT之父却反手把它「断网」了近一百年??

如果模型没见过答案,依然能够现学现用,那它靠的究竟是记忆,还是学习?

也不知道大佬这次,究竟又提前押注了什么...

不过按照他的惯例,等外界终于看懂这道题时,他本人多半已经跑去做下一道了~

参考链接:

[1]https://x.com/InvestLikeBest/status/2086849947119333878?s=20

[2]https://www.wired.com/story/what-openai-really-wants/

[3]https://www.bostonglobe.com/2023/06/10/business/how-couple-olin-college-students-helped-spark-ai-chatbot-revolution/

[4]https://www.newyorker.com/books/under-review/can-sam-altman-be-trusted-with-the-future

本文来自微信公众号“量子位”,作者:关注前沿科技

热门币种推荐

相关问答

QAlec Radford在人工智能领域有哪些主要贡献?

AAlec Radford是多项开创性AI模型和技术的核心贡献者,主要包括:作为第一作者领导了GPT-1、GPT-2、CLIP和Whisper的研发;参与了GPT-3、DALL·E、Scaling Law、GPT-4/4o等关键工作;早期与团队共同提出的DCGAN极大地稳定了生成对抗网络的训练。他的工作奠定了现代生成式AI的基础,尤其是在通过大量数据预测简单任务以涌现通用能力这一核心研究路线上。

Q根据文章,奥特曼(Sam Altman)如何评价Alec Radford?

A奥特曼将Alec Radford评价为“AI历史上最重要、却不太为人所知的研究者”,并称他为OpenAI发展过程中“最欣赏的幕后功臣”。他表示,Alec不仅做出了演化成GPT系列的关键工作,还不断启发和引导团队将研究推向后来被证明极为重要的方向。共事者认为他是“几十年一遇的天才”,同时也是他们合作过“最善良、最好的人之一”。

Q文章中提到“无监督情感神经元”是什么?它有什么意义?

A“无监督情感神经元”是Alec Radford早期的一个关键实验发现。他使用约1亿条亚马逊商品评论训练一个仅预测下一个字符的语言模型。在训练过程中,模型内部自发形成了一个能够区分评论正负情绪的神经元。通过调节这个神经元,可以控制模型生成好评或差评。这一现象首次证明:当模型在足够多数据上完成简单的预测任务时,可能会自发学习到训练目标中未明确指定的高层次概念或能力,这为后续GPT系列“预测下一个词”能涌现出强大通用智能的路线提供了重要启示。

QGPT系列项目从早期到后期,Alec Radford的角色发生了什么变化?

AAlec Radford的角色从早期的核心驱动者逐渐转变为关键参与者。在GPT-1和GPT-2时期,他是论文的第一作者和项目的主要负责人,从零到一确立了“预测下一个词”的核心技术路线。到GPT-3时期,项目演变为需要大规模工程和资源协同的大型项目,他的署名位置下降到第29位(在31位作者中),第一作者变为Tom Brown。这标志着他的个人探索已成功转化为OpenAI的核心技术战略,项目主导权也从少数研究者转向了整个公司的工程与研究体系。

QAlec Radford离开OpenAI后进行的“Talkie”项目有什么特别之处?

A“Talkie”项目是一个极具反常规思维的实验。它是一个“古董语言模型”,其预训练语料严格限定在1931年1月1日之前出版的英文材料,因此模型对现代社会、科技(如电视、互联网、二战)一无所知。项目的核心目的是测试一个模型在完全未接触过某些知识(如Python编程)的情况下,仅通过少量示例和后训练,能以多快的速度掌握一项全新技能。这旨在探究大模型的能力究竟是基于对训练数据的记忆,还是真正的学习和泛化能力,与当前行业追求更多数据、更大规模的趋势形成了鲜明对比。

你可能也喜欢

区块链能否在没有自身加密货币的情况下运行

区块链本质上是一种分布式数据库技术,其运行并不绝对依赖于原生加密货币。文章通过对比不同案例阐明了这一观点。 以比特币(BTC)、以太坊(ETH)和Solana(SOL)为代表的公链,其原生代币被深度嵌入网络运作机制:用于支付交易手续费、激励矿工或验证者(如工作量证明或权益证明),并作为安全抵押(如以太坊的32 ETH 质押要求)。代币在这里充当了访问受限网络资源(区块空间)的“门票”和防止垃圾交易攻击的经济屏障,同时实现了对去中心化维护者的自动、无国界激励。 然而,也存在无需原生代币的区块链模式: 1. **企业级私有链**:如Hyperledger Fabric,在参与者预先已知且受信的联盟环境中,依靠权限管理和传统法律合同来维持运行与安全,无需内部代币经济。 2. **使用现有代币的公链**:例如以太坊二层网络Base,其运行多年并未发行强制使用的原生代币,而是直接使用ETH支付Gas费,证明了公链可以依赖已成熟的资产作为“燃料”。 3. **对用户隐藏代币**:即便网络底层需要特定代币(如SOL),应用层可以通过中继服务或“Gas代付”机制,让用户直接使用稳定币(如USDC)支付费用,而由服务商进行代币转换,用户无需持有底层资产。 因此,判断一个区块链项目是否真的需要原生代币,关键问题是:**如果移除该代币,网络的核心功能(如安全性、激励模型、交易处理)是否会崩溃?** 如果代币仅用于治理、折扣等附加功能,而非基础设施的必需组成部分,则其必要性就弱得多。加密货币是许多区块链的重要特征,但并非其存在的先决条件。

cryptonews.ru4分钟前

区块链能否在没有自身加密货币的情况下运行

cryptonews.ru4分钟前

从全民玩梗到Meme币暴涨,一场“牛来”的注意力牛市

国产动画《牛来》因制作粗糙、剧情荒诞却在网络上意外爆红,票房从数千元飙升至千万元以上。其热度从影院蔓延至社交媒体,引发网友大量二次创作和玩梗,并迅速波及股市与加密货币市场。 在币圈,与其同名的Meme币“牛来”在BNB Chain上线后市值一度从约1万美元暴涨至超4700万美元。电影本身的病毒式传播、社区的二创热情、以及一场涉及CZ地址的链上销毁乌龙事件共同助推了这场狂欢。与此同时,多个交易地址因早期买入该代币而获得数十倍至上千倍的惊人回报,暴富故事进一步放大了传播效应。“牛来”的片名也与“牛市来了”谐音,精准击中了加密社区对牛市的期待情绪。 在股市,电影被股民戏称为“A股股民必看电影”。影片中粗糙画面与精美海报的反差被类比为股市的包装与现实落差。片中镜头更被解读为“绊倒体”(谐音“半导体”)等金融梗,引发热议。部分股民甚至组团观影“讨彩头”,希望带来牛市。A股市场中名称带“牛”的个股如罗牛山、金牛化工等也出现短线热度上升。 归根结底,《牛来》的走红并非源于内容质量,而是其强烈的反差感、可塑性以及为不同群体提供的情绪出口和社交货币。在注意力经济时代,全民参与式的解读、玩梗与再创作,构成了这部电影最意外的“彩蛋”。

marsbit9分钟前

从全民玩梗到Meme币暴涨,一场“牛来”的注意力牛市

marsbit9分钟前

交易

现货

热门文章

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.8k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片