从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步

marsbit發佈於 2026-08-03更新於 2026-08-03

文章摘要

在2026年YC创业学校的访谈中,Google传奇工程师Jeff Dean分享了对AI未来发展的深刻洞见。他认为,AI竞争正从追求“更大的模型”转向“更好地组织智能”。当前AI的能力已接近初级工程师,但更重要的是构建能让AI长期工作、持续试错并自动验证的系统。 Jeff Dean指出,下一代AI的关键在于推理硬件、能量效率、数据搬运成本以及上下文工程。他特别强调,AI的实际成本往往不是计算本身,而是数据搬运的能耗。同时,他将上下文工程视为小团队的重要机会——通过组织领域知识、工具和工作流,让通用模型在特定场景中更可靠。 对于创业公司,他提出了“1%法则”:应寻找当前通用模型成功率极低(接近0%或1%)的任务,这些往往是存在专有数据、专业验证或结构性盲区的领域,而非模型已能做到20%的任务。随着AI自动化执行成本下降,“问题选择”、“规格定义”和“品味”将变得更为稀缺和重要。 他展望未来,AI将自动化科学方法本身,通过高速实验循环和廉价验证器加速发现。最终,最稀缺的能力仍将是清晰地识别和定义真正有价值的问题。

2026 年的 YC Startup School 上,Jeff Dean 的声音有些沙哑。

访谈刚开始,他便解释自己失声了,今天听起来和平时不太一样。但这并没有影响台下听众的注意力。坐在他面前的 YC 合伙人 Diana Hu,一口气列出了一串足以写进计算机史的名字:MapReduce、BigTable、TensorFlow、TPU、Gemini。

任何一个项目,都足够成为一名工程师职业生涯的代表作。它们却集中出现在 Jeff Dean 和他身边一批 Google 工程师的履历里。

Diana 没有把访谈做成一次功绩回顾。她更关心另一个问题:当生成式 AI 已经席卷软件行业,Jeff Dean 这种最擅长从底层重构系统的人,今天究竟在看什么?

答案并不是更大的模型。

在这场近一小时的对话里,Jeff Dean 反复谈到推理硬件、能量、数据搬运、上下文工程、长时间运行的 Agent、自动化实验系统,以及创业公司如何避开通用模型的正面碾压。他讲的看似分散,背后却有一条非常清楚的主线:AI 的下一阶段,不只是把模型训练得更聪明,而是把模型放进一个能长期工作、持续试错、自动验证、不断积累能力的系统里。

这也意味着,AI 竞争正在从「谁有更大的模型」,转向「谁能更好地组织智能」。

一、AI 已经像初级工程师,但这不是最重要的变化

2025 年 5 月,Jeff Dean 曾做过一个引发广泛讨论的判断:AI 的能力已经接近一名初级工程师

一年后,Diana 问他,这个预测实现得怎么样?

Jeff Dean 的回答很直接。他认为,这个判断「相当准确」。模型在 Agent 化、长流程编码和复杂任务上的进步,甚至比他当时预想得更快。

「模型完成越来越复杂任务的能力,增长得比我预期更快。」他说。

更值得注意的是,这种能力不再局限于写代码。越来越多 Agent 系统开始进入科学、工程和其他专业领域。它们不只是回答问题,而是拆任务、用工具、运行实验、读取结果,再根据反馈继续行动。

把 AI 类比成初级工程师,容易让人把注意力放在人力替代上。但 Jeff Dean 更关心的是另一层变化:当一个「初级工程师」可以复制成几十个、几百个,并行工作几天甚至几周,组织生产的方式会发生什么变化?

在传统团队里,初级工程师需要上手业务,需要理解工具,需要不断得到反馈。Agent 也一样。只不过它的培训材料不再只是文档,而是提示词、工具说明、技能文件、测试体系、评估器,以及整个上下文环境。

这使 AI 工程出现了一个新的分工。

过去,工程师主要负责写代码。未来,更多工程师会负责定义问题,搭建环境,编写规范,设计反馈回路,再调度一群 Agent 去完成任务

Jeff Dean 对 2027 年的预测正是如此。他认为,机器学习系统会越来越多地参与改进机器学习系统本身。它们会把目标拆成子问题,自动运行大量实验,比较结果,再把有效方案组合起来,形成更强的新系统。

「只要一个领域存在可测量的目标,就有机会取得很大进展。」

这句话是整场访谈的第一把钥匙。

AI 自动化最先攻入的,不一定是知识最多的领域,而是反馈最清晰的领域。代码能不能通过测试,芯片布局能不能降低面积,模型结构能不能提高精度,材料性质是否满足要求,这些问题都有相对明确的评价标准。只要评价器足够可靠,机器就能用极高频率反复试验。

所以,AI 时代真正重要的单位,可能不再是一次回答,而是一次完整的闭环:提出方案、执行方案、测量结果、修正方向。

二、改变 Google 搜索的是一道算术题

Jeff Dean 的许多代表性工作,都来自一个非常朴素的起点:先把数量级算清楚。

2001 年,Google 搜索仍大量依赖硬盘。硬盘容量大,但访问速度慢。Jeff Dean 和 Sanjay Ghemawat 做了一次估算,发现 Google 当时的整份搜索索引,已经可以放进所有服务器的内存里。

今天听起来,这只是一次存储介质升级。但在当时,它意味着完全不同的系统设计。

如果索引主要待在硬盘上,查询需要等待机械寻道。只要把索引放入内存,访问延迟就能骤降。两人很快写出新版本,并在几天内把它送进生产环境。Google 搜索由此明显变快。

这个故事最容易被包装成天才灵光一现。Jeff Dean 的讲法却更像一名工程师在陈述常识:系统条件变了,原来不成立的方案突然成立,那就应该重新计算一次。

很多行业创新都发生在这种时刻。

一个旧问题长期存在,人们已经习惯围绕它打补丁。后来,硬件价格、内存容量、网络带宽或模型能力跨过某个临界点,原来的约束消失了。可大多数人仍沿用旧架构,因为旧架构已经变成常识。

Jeff Dean 擅长做的,是把常识重新变成假设

他会问:为什么一定要这样?今天的数量级还是昨天的数量级吗?如果把最贵的一步换掉,整个系统会不会出现完全不同的形态?

这也是他给创业者的建议。不要只看现有方案哪里不够好,而要从第一性原理重新看问题。能不能把性能提高一个数量级?能不能把成本降低两个数量级?能不能不再沿用行业默认的实现路径?

「有时候,你只需要眯起眼睛看一个问题,不要被今天的解法锚定,而是从第一性原理思考应该怎样解决。」

这句话听起来并不神秘。真正困难的是,多数人进入一个行业后,会迅速学会这个行业的所有默认答案。经验帮助人提高效率,也会让人失去重新提问的能力。

三、三分钟语音,为什么催生了一颗 TPU

2013 年,Google 的深度学习语音识别开始显著超过旧系统。错误率下降了一半,相当于过去二十年语音识别进展在几个月里集中发生。

产品团队当然兴奋。Jeff Dean 却先算了一笔账。

如果语音识别真的变好,用户就会更愿意使用。假设每名 Google 用户每天只使用三分钟语音识别,Google 需要多少服务器才能支撑?

结果并不乐观。按照当时 CPU 的效率,Google 可能需要把服务器规模扩大一倍。

这就是 TPU 的起点。

它不是因为研究团队突然想造芯片,也不是为了证明 Google 有能力做硬件,而是因为一个成功的模型即将制造一个无法承受的服务成本。

这段历史揭示了 AI 产品中一个经常被忽略的规律:模型效果提升,并不总是降低成本。恰恰相反,效果越好,使用量越大,系统压力越重

当语音识别不好用时,用户很少调用。系统成本不是问题。当错误率大幅下降,需求突然被释放,原本隐藏在后台的算力约束就会浮出水面。

TPU 选择的路径,是为机器学习最核心的计算模式做专用硬件。它不需要运行浏览器,也不需要处理所有通用程序。它主要擅长低精度、稠密线性代数。这类计算恰好位于现代机器学习的中心。

第一代 TPU 最终带来了数量级上的收益。按照 Jeff Dean 的说法,它比当时的 CPU 和 GPU 节能 30 到 80 倍,延迟也低了 20 到 30 倍。

这里还有一个容易被忽略的设计尺度。

TPU 很专用,但没有专用到只能运行某一种固定模型。团队知道机器学习算法还会快速变化,于是把芯片设计成一种较通用的线性代数系统。它牺牲了运行 Chrome 或 Word 的能力,却保留了支持未来算法演进的空间。

这是一种很难把握的平衡。专用得不够,收益不明显。专用得太狠,算法一变,硬件就会过时。

Jeff Dean 对今天推理硬件的判断,和当年的 TPU 有明显呼应。他认为,下一轮重要机会仍然在专用化,但重心会进一步转向低延迟、低能耗推理

「想象一下,如果延迟能改善 50 倍,你可以做什么。」

当模型回复需要十几秒时,人们会把它当成一个偶尔咨询的工具。当延迟接近即时,它才可能真正进入交互界面、机器人、实时视频、操作系统和连续决策流程。

等待不是一个小体验问题。等待会改变产品形态。

四、AI 的成本中心,不是计算,而是搬运数据

如果要为 2026 年的 AI 工程师更新一版「每个工程师都应该知道的延迟数字」,Jeff Dean 认为,重点应该从硬盘寻道、缓存未命中和跨洲网络延迟,转向芯片内部的数据流。

工程师需要知道:主存到片上内存的带宽是多少,片上内存到乘法单元的带宽是多少,一次乘法需要多少能量,芯片之间如何互连,500 颗芯片扩展到 1 万颗芯片时,网络效率会怎样下降。

这些数字看起来离产品很远,实际却在决定什么产品能成立。

Jeff Dean 给出了一个极具冲击力的比例。完成一次数学乘法,大约只需要一个皮焦耳的能量。把数据从高带宽内存搬到计算单元,能量成本可能高出约 1000 倍。

换句话说,今天 AI 系统中的昂贵动作,常常不是「算」,而是「把要算的东西搬过来」。

这也解释了为什么批处理如此重要。

一组模型权重从内存被搬入计算单元后,如果只处理一个 token,数据搬运成本就全部压在这一个 token 上。如果同时处理更大的批次,同一份权重可以服务更多计算,能量和带宽成本便被摊薄。

但批处理和低延迟天然冲突。为了凑够一批请求,系统往往需要等待。吞吐提高了,单个用户的响应却可能变慢。

因此,许多看似属于模型层的问题,其实是硬件和系统问题。训练为何使用大批次,推理为何需要 KV Cache,模型为何追求低精度,系统为何需要量化,背后都离不开数据搬运和能量约束。

Jeff Dean 近期更关注推理,也正是因为推理对延迟极度敏感。训练任务跑慢一点,往往只是实验结束得晚。推理任务每多等一秒,都会直接影响用户体验和 Agent 的工作效率。

如果一个 Agent 要连续调用模型 1000 次,单次延迟降低 50%,整个任务的完成时间就可能出现巨大差异。更不用说未来 Agent 要运行数天或数周。

因此,AI 的「能源问题」并非一个遥远的环保议题。它直接决定模型能否便宜地服务更多人,决定 Agent 能否持续运行,也决定创业公司的毛利是否健康。

五、模型只是一个零件,上下文才是 Agent 的工作现场

过去几年,AI 行业习惯用参数量、训练数据和基准分数衡量进步。2026 年,Jeff Dean 更强调模型周围的一切。

一个真正有用的 AI 系统,除了模型,还需要检索、工具、记忆、历史信息、执行环境和反馈机制。模型知道有哪些工具,知道何时调用工具,知道如何把复杂问题拆成一串动作,也要能比较多种方案,判断哪一种更可能成功。

这就是「上下文工程」开始走到舞台中央的原因。

Jeff Dean 说,模型在训练阶段见过的信息,最终被「搅拌」进数千亿乃至数万亿参数里。它们像一锅浓汤,知识存在,但未必清晰。真正放进当前上下文的信息,对模型来说更加直接,也更容易被准确使用。

这给小团队留下了一个重要机会。

训练基础模型需要海量资本、数据和算力。上下文工程却可以从一个 API 开始。创业者可以围绕具体业务,把领域知识、工具流程、客户数据和评估标准组织起来,让通用模型在一个窄场景里表现得更可靠。

Jeff Dean 举了一个自己的例子。

他和 Sanjay Ghemawat 经常优化 Google 内部的底层库。这些数据结构可能运行在数百万个进程中,一 点点 性能差异都会被规模放大。传统做法是工程师先写微基准,测量当前性能,再修改代码,重新运行基准,观察缓存占用和性能变化,然后继续迭代。

两人把这套工作方法写成了一项 Agent 技能。模型学会了如何运行基准、修改代码、比较结果,再根据测量继续优化。

「我们只是把人会采用的方法,以模型可以使用的形式交给了它。」

这句话几乎可以视为上下文工程的朴素定义。

它不是神秘的提示词技巧,也不是堆更多背景材料。它是在回答三个问题:专家会按什么步骤做事,系统有哪些可靠工具,结果应该怎样被验证。

当这些内容被结构化之后,模型获得的不是更多知识,而是一套可重复执行的方法。

这也是为什么「技能(skill)」会成为 Agent 生态中的关键资产。一个优秀技能文件,可能封装了团队多年的隐性经验。它告诉模型遇到某类问题时先做什么,哪些错误最常见,哪些工具值得信任,什么结果才算完成。

未来公司的差异化,很可能不只存在于模型权重里,也存在于这些被编码进工作流的经验里。

六、Agent 为什么走到第 30 步就开始失控

几乎所有真正做过 Agent 的团队,都见过同一种场景。

前几步很顺。模型能读需求,能调工具,能写代码。到了第 30 步或第 50 步,它开始忘记目标,误解状态,重复动作,或者沿着一个错误方向越走越远。

Jeff Dean 把其中一个原因归结为分布外问题。

模型在训练中见过大量常见任务。只要任务仍位于它熟悉的「明亮道路」上,表现通常不错。一旦连续操作把它带到不熟悉的状态,性能就会突然下降。越偏离舒适区,错误越容易累积。

解决方法之一,是提供技能和提示,把模型尽量约束在它熟悉的路径上。另一个方法,是使用多 Agent 系统

多个 Agent 可以尝试不同方案,再由另一个模型担任评估者,判断哪些方向更有希望。失败的分支被丢弃,成功的分支继续推进。这本质上是在推理阶段进行搜索。

它和人类团队的工作方式并不陌生。面对复杂问题,一个人提出方案,另一个人审查风险,第三个人运行实验。团队不会把全部希望押在第一条思路上,而是通过分工和反馈降低单点失误。

Agent 运行时间越长,系统设计越不能依赖一次正确。

真正可靠的长程 Agent,需要检查点、状态管理、回滚、分支探索、外部评估、权限控制和异常恢复。它更像一个分布式系统,而不是一个超长聊天窗口。

这正是 Jeff Dean 的背景开始重新显得关键的地方。

MapReduce 解决的核心问题之一,就是如何让大量不可靠机器完成可靠计算。今天的 Agent 系统面对相似矛盾:单次模型调用并不完美,工具也会失败,但整个任务仍要尽可能稳定地完成。

未来优秀的 Agent 平台,可能会继承许多分布式系统思想。任务可以拆分,结果可以验证,失败可以重试,状态可以恢复,局部错误不应该摧毁整个流程。

当 Jeff Dean 说 Agent 将运行几天甚至几周时,他不是在描述一个更长的聊天。他在描述一种新的计算基础设施。

七、两三个人如何赢过 Google:寻找模型成功率只有 1% 的问题

在 Startup School 的语境里,最受关注的问题当然是创业机会。

Google 可以联合设计芯片、数据中心、模型和产品。Gemini 这样的通用模型还在快速扩张能力边界。一个两三人的团队,凭什么赢?

Jeff Dean 的回答并不浪漫。

小团队的机会,通常存在于通用模型没有充分关注的具体领域。创业者可以把产品界面、专有数据、工作流和领域技能组合起来,在一个窄场景里提供更高准确率和更好体验。

但他随即给出警告:通用模型正在迅速变强。今天看似独立的产品功能,六个月或十二个月后,可能被基础模型直接覆盖。

因此,创业者需要判断自己的优势是否耐久。

Jeff Dean 给出了一条很具体的筛选标准:寻找那些当前通用模型成功率接近 0% 或 1% 的任务,而不是已经能做到 20% 的任务。

「如果模型完全失败,这可能是一个好迹象。如果它已经能做一部分,只是做得不太好,那反而未必是好迹象。」

原因很简单。20% 意味着能力已经开始出现。更多数据、更大模型和更长推理,很可能快速把它推向可用。0% 或 1% 则说明任务可能缺少关键数据、特殊工具、领域反馈,或者需要一种通用模型短期难以获得的能力。

这可以称为 Jeff Dean 的「1% 法则」。

它并不是建议创业者专挑最难的问题,而是寻找通用模型存在结构性盲区的问题。

这种盲区大致有三类。

第一类是专有数据。通用模型能组织世界信息,却未必能访问某个用户的全部个人资料、某家公司的内部流程、某种设备产生的实时数据。创业产品一旦获得这些数据,就能形成不同于基础模型的视野。

第二类是专业评价。很多行业不是缺少生成能力,而是缺少可靠判断。医疗、材料、芯片、制造和科学研究,都需要高质量验证器。谁能定义「什么是对的」,谁就能让 Agent 持续优化。

第三类是窄而深的模型。AlphaFold 并不是通用聊天模型,它针对蛋白质结构问题建立了高度专业化能力。材料科学、芯片设计和其他专业领域,也可能出现类似机会。

这套判断对创业者并不轻松。它要求团队既理解模型能力边界,也理解行业深处的问题。只懂 AI,容易做出很快被平台吸收的功能。只懂行业,又可能低估模型进步速度。

真正的机会位于两者交界处。

八、当代码不再稀缺,规格、品味和问题选择会更贵

Diana 提出一个假设:如果未来每位创始人都能同时管理 50 个、100 个 Agent,所有代码都由 Agent 写,什么能力会变得稀缺?

Jeff Dean 的回答是「品味」。

更准确地说,是判断应该让 Agent 做什么。

他认为,研究工作的大部分价值不在于把实验执行得多漂亮,而在于是否选择了一个值得研究的问题。一个团队可以用最精湛的方法,完成一项无关紧要的研究。也可以抓住一个关键问题,只要解决,就改变整个领域。

Agent 让执行成本下降之后,问题选择的重要性会进一步上升。

过去,一个模糊想法会因为开发成本太高而自然消失。未来,只要调动足够多 Agent,很多想法都能被迅速做成原型。世界不会因此自动出现更多好产品,只会出现更多产品。

规格也会变得更重要。

Jeff Dean 说,和虚拟 Agent 协作时,目标越清晰,成功率越高。过去,模糊需求交给一名资深工程师,对方可以追问,也能依靠共享背景补全意图。Agent 虽然也能提问,却更容易在缺少上下文时自行猜测。

一个典型的高成功率任务,是把软件从一种编程语言迁移到另一种语言。原因不是迁移简单,而是规格极其完整。旧代码定义了行为,测试定义了边界,Agent 可以逐项对照,直到新版本表现一致。

「现在 Agent 可以替你写软件,但说明你究竟想要什么,反而变得更重要了。」

这句话对所谓AI 原生组织有直接启示。

未来的管理者不只是分配任务,而要编写更清晰的目标和验收标准。设计文档不再只是团队沟通材料,也会成为机器执行的输入。测试、指标、约束和样例,会从开发流程末端前移到任务定义阶段。

至于「品味」如何训练,Jeff Dean 给出的方法很务实。

写下一批你认为未来 12 个月会变得重要的事情。你不必全部去做。12 个月后重新检查,哪些判断成真,哪些被别人做出来,哪些毫无进展。通过不断积累预测样本,人会逐渐校准自己的判断。

品味并不完全是天赋。它也可以通过复盘训练。

九、好的思想实验,先把行业最牢固的前提拿掉

访谈后半段,Jeff Dean 分享了一个颇为疯狂的思想实验。

过去 60 年,芯片行业一直在追求更小、更稳定、错误率更低的晶体管。人们默认,同一设计制造出的芯片应该尽可能完全一致,位翻转越少越好。

可在大型分布式系统中,工程师早已接受单个组件会失效。硬盘会坏,机器会宕机,交换机会出问题。系统可靠性并不来自每个部件绝不出错,而来自复制、校验、冗余和恢复。

于是 Jeff Dean 问:如果晶体管每天会发生 20 次错误,而不是几百万年才出一次错,会怎样?

这并不是一项现实产品计划。他只是试图把一个习以为常的前提拿掉。也许极不可靠的晶体管能以完全不同的方式制造,系统则通过多路径和高层冗余保证结果。

多数思想实验最终不会变成产品。很多行业做法持续数十年,确实有充分理由。但 Jeff Dean 认为,仍应定期重新检查这些理由。

MapReduce 就来自类似过程。

早期 Google 的爬虫和索引系统包含大量手工并行代码、检查点和故障恢复逻辑。真正的业务计算往往很简单,比如读取所有网页,判断页面语言。可大量系统代码把简单意图淹没了。

Jeff Dean 和 Sanjay Ghemawat 从函数式编程中找到灵感。他们把大量任务抽象成 Map 和 Reduce,把并行化、调度、容错和重试下沉到统一框架里。业务开发者只需要表达计算本身。

这项设计并没有让机器变得不出错。它让错误变得可以被系统吸收。

今天的 Agent 工程也可能处在类似阶段。大量团队仍在为每个任务手工编排提示词、重试逻辑和工具调用。未来,是否会出现一个像 MapReduce 一样简洁的抽象,让长程 Agent 的分解、验证、恢复和并行探索成为底层能力?

这也许正是下一批基础设施公司的机会。

十、AI 开始构建更好的 AI,科学方法被压缩成高速循环

Jeff Dean 对未来最兴奋的方向,是把科学方法本身自动化。

传统科研流程是提出假设、设计实验、运行实验、分析结果,再产生下一轮假设。这个循环的速度,长期受制于实验成本和验证延迟。

AI 可以改变两部分。

一部分是自动提出和执行更多实验。另一部分是把昂贵验证器变成廉价近似模型

Jeff Dean 举了量子化学的例子。研究人员要判断一种分子构型的性质,可以运行密度泛函理论模拟。一次模拟可能需要一整夜。Google 的研究人员用大量模拟输入和输出训练了一个神经网络近似器。它接近原模拟器的准确度,却快了约 30 万倍。

验证速度变化之后,科学问题的形态也会变化。

过去筛选 1000 万个候选方案,可能是一个需要数月算力的项目。现在,研究者吃一顿午饭的时间,系统就能完成初筛。实验不再是珍贵的单次下注,而变成高频搜索。

这也是 AlphaEvolve、AlphaChip 等系统背后的共同逻辑。模型提出方案,工具执行方案,评价器筛选结果,优秀结果进入下一轮。只要闭环足够快,系统就能在巨大的解空间中持续探索。

机器学习本身也会成为这种自动化科学的对象。

今天,大型研究团队通常由人提出新架构或训练方法,先跑小规模实验,再挑选有希望的方案放大。Jeff Dean 认为,没有根本障碍阻止模型接管其中越来越多环节。人给出高层方向,系统自动探索结构、数据配方和训练策略,再把成功实验组合成新模型。

未来衡量研究效率的指标,可能不只是每秒浮点运算,而是「每单位算力产生多少有效发现」。

算力当然重要。如何把算力转化为发现,更重要。

十一、被 NeurIPS 拒绝的蒸馏论文,以及如何看待失败

2014 年,Jeff Dean、Geoff Hinton 和 Oriol Vinyals 提交了一篇关于知识蒸馏的论文。今天,知识蒸馏已经是模型压缩和能力迁移中的基础方法。大模型作为教师,把能力传递给更小、更快、更便宜的学生模型。

这篇后来影响深远的论文,当年却被 NeurIPS 拒绝。

一名审稿人认为,它「不太可能产生重大影响」。感兴趣的读者可访问《被拒≠失败!这些高影响力论文都被顶会拒收过》。

Jeff Dean 谈起这段经历时没有愤怒。他说,审稿人可能并不了解大规模 AI 服务面临的现实问题。对 Google 来说,把昂贵大模型转化为可服务数亿用户的小模型,显然非常重要。对只关注理论新颖性的审稿人来说,它未必显得足够「基础」。

论文被拒后,团队把它放上 arXiv。行业照样读到了它,也照样开始使用。

今天,Gemini 的 Flash 模型能够在较小体量和较低延迟下保持强能力,蒸馏正是其中的重要方法之一。

这个故事并不只是「坚持就会成功」的励志材料。它说明评价体系总有盲区。一个方案的价值,有时只有真正承受过那个系统瓶颈的人才能立刻看见。

对创业者来说,这同样重要。

市场、投资人和同行的否定,可能意味着方向错误,也可能只是对方没有处在同一个问题现场。区别在于,团队是否有足够具体的证据,知道这个问题为什么重要,为什么现在能解决。

Jeff Dean 没有鼓励人盲目坚持。他鼓励的是:理解问题,持续验证,然后不要把一次评审当成世界的最终判断。

十二、年轻的 Jeff Dean 今天会做什么

访谈接近尾声时,Diana 提出了一个带有想象力的问题。

如果把 1999 年加入 Google 时的年轻 Jeff Dean 传送到 2026 年,他会加入一家前沿实验室,还是和两三个朋友创办公司?

Jeff Dean 没有给出标准答案。

大组织拥有结构、平台和大量优秀同事。一个人在其中可以接触自己不了解的知识,也能借助成熟产品影响全球用户。小团队则更自由,也承担更大风险。创始人必须真正相信一个问题,愿意用几年时间承受不确定性。

他给出的判断标准,比「加入大厂还是创业」更根本。

「如果我解决了这个问题,并且最好的结果真的发生了,世界会因此明显变好吗?还是大家只会说,嗯,挺酷的,然后就这样?」

如果答案只是「挺酷的」,那可能不值得投入最宝贵的时间。

他也强调同伴的重要性。要找有互补能力的人,也要找低自我、愿意协作、相处愉快的人。真正困难的问题往往需要长期共事。团队成员最好各自拥有别人没有的工具,并在共同工作中继续扩充自己的「工具腰带」。

这番话有一种老派工程师的朴素。

AI 行业喜欢谈指数增长、超级智能和巨额融资。Jeff Dean 最后仍把选择落回三件小事:做一个真正关心的问题,和喜欢的人一起工作,尽力让世界变得更好。

结语:AI 时代最稀缺的,仍然是把问题看清楚

Jeff Dean 的职业生涯里,有许多被反复讲述的传奇。

他和 Sanjay Ghemawat 在几天内重写搜索系统,让索引进入内存。一次关于三分钟语音的估算,推动 Google 造出 TPU。MapReduce 把大规模并行和容错藏进统一抽象。知识蒸馏从一篇被拒论文,变成行业基础技术。

这些故事很容易让人把他想象成一个不断获得灵感的天才。

但从这场访谈看,他的方法其实高度一致。

先算清数量级。再找到真正的瓶颈。然后质疑默认假设,建立一个更简单的抽象。最后,用测量和反馈推动系统不断迭代。

今天的 AI 行业正在经历类似转折。

模型已经足够强,强到可以承担初级工程师级别的任务。接下来,决定实际生产力的,不只是模型智商,而是推理成本、上下文组织、工具质量、验证速度和长程运行可靠性。

Agent 会越来越像团队成员。可它们需要清晰规格,需要技能,需要检查点,需要评价者,也需要一个能容纳失败的系统。

创业公司的机会也不会消失,只是会变得更苛刻。最好不要去做通用模型已经能完成 20% 的事情,而要寻找那些成功率仍接近 0% 或 1% 的问题。那里可能藏着专有数据、专业评价器、窄领域模型,或全新的系统抽象。

当代码生成越来越便宜,真正昂贵的会是问题本身

什么值得做?什么约束已经过时?什么变化刚刚跨过临界点?什么系统如果快 50 倍,会变成完全不同的产品?

Jeff Dean 没有为 6000 名创业者给出一份机会清单。他给的是一种更耐用的思考方式。

别急着追逐最热的答案。

先把问题算一遍。

参考链接

https://x.com/ycombinator/status/2082938685071491219

https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:Panda

熱門幣種推薦

相關問答

QJeff Dean在2026年的访谈中认为AI的下一阶段竞争重点是什么?

AAI的下一阶段竞争重点正从‘谁有更大的模型’转向‘谁能更好地组织智能’,即把模型放进一个能长期工作、持续试错、自动验证、不断积累能力的系统里。

QJeff Dean提到TPU诞生的直接原因是什么?它带来了什么样的性能提升?

ATPU诞生的直接原因是Google的深度学习语音识别模型效果显著提升后,预测用户使用量激增,导致基于CPU的服务成本无法承受。第一代TPU比当时的CPU和GPU节能30到80倍,延迟也低了20到30倍。

Q根据Jeff Dean的观点,小团队创业应如何避开与Google等大公司在通用模型上的正面竞争?

A小团队应寻找当前通用模型成功率接近0%或1%的任务,而不是已经能做到20%的任务。这些任务可能存在通用模型的结构性盲区,如依赖专有数据、专业评价器或需要窄而深的领域模型。

Q在Jeff Dean看来,当AI Agent能够大量编写代码时,什么能力会变得尤为稀缺和重要?

A当AI Agent能大量编写代码时,‘品味’(即判断应该让Agent做什么)和‘规格’(即清晰定义目标、验收标准的能力)会变得尤为稀缺和重要。管理者需要编写更清晰的目标和验收标准。

QJeff Dean对AI在科学研究自动化方面的前景有何看法?他举了什么例子?

AJeff Dean对AI自动化科学方法的前景感到兴奋,认为AI可以加速提出和执行实验,并将昂贵验证器替换为廉价近似模型。他举了量子化学的例子,用神经网络近似器代替密度泛函理论模拟,速度提升了约30万倍,从而将实验筛选变为高频搜索过程。

你可能也喜歡

年薪百万抢电工,Meta急到自己办技校

AI竞赛正面临新的瓶颈:工地。美国正面临严重的电工、建筑工等技术工人短缺,这已成为微软、Meta、OpenAI等公司快速建设超大规模AI数据中心(如OpenAI耗资160亿美元的“星际之门”项目)的“头号障碍”。 尽管AI公司愿支付高薪(如电工年薪可达24-28万美元),远超传统行业,但熟练技工仍供不应求。麦肯锡预测,美国在2023-2030年间需额外培养13万名电工和24万名建筑工,而劳工统计局预计每年仍有8万个电工岗位空缺。这种短缺导致项目延迟,每月可能造成数百万美元的收入损失。 AI数据中心建设复杂,需应对巨大功耗(一座设施耗电堪比数十万户家庭)、复杂的配电系统以及高密度散热(需液冷技术)等挑战,因此亟需大量技术娴熟的工人。 为此,科技巨头开始亲自下场培养人才。例如,Meta投入1.15亿美元建立建筑工人培训学校,提供免费培训及生活补贴,以快速输送工人上岗。OpenAI则与建筑工会合作,提前锁定熟练劳动力。同时,企业也将招聘目光投向高中生,鼓励年轻人投身技工行业。这些举措已见成效,Z世代对技工职业的兴趣显著上升。 然而,更深层的挑战在于电力。AI数据中心用电量正以惊人速度增长,已推高部分地区的电价。此外,数据中心建设是项目制的,建设期需要成千上万的工人,但建成后仅需少量常驻人员。这意味着未来可能面临熟练工人短期过剩、并流向其他行业压低薪资的风险。如何实现劳动力与电力资源的长期平衡,仍是悬而未决的问题。

marsbit1 小時前

年薪百万抢电工,Meta急到自己办技校

marsbit1 小時前

OpenAI 不靠最贵的模型卖钱了

OpenAI近期调整了API定价策略,旗舰模型GPT-5.6 Luna降价80%,Terra降价20%,而顶级模型Sol未降价但新增了更快的“Fast”模式。此次调整的核心并非单纯的价格战,而是标志着OpenAI首次引导用户根据任务需求选择不同模型,而非一味追求最强模型。官方建议复杂任务可由Sol进行规划,再由Luna等成本更优的模型执行。 此举与Anthropic近期推出半价替代旗舰的Claude Opus 5策略相似,显示硅谷领先公司正形成默契:旗舰模型(如Sol、Fable)的角色正从直接盈利转向树立技术品牌和探索上限,而商业化走量和利润则主要由中端及性价比模型(如Luna、Opus)承担。这类似于汽车等行业“旗舰立形象,走量车型赚利润”的模式。 更深层的变化在于成本下降的驱动力。OpenAI透露,此次降价部分得益于由Sol模型自身参与优化底层生产内核,实现了效率提升与成本降低,开启了“模型优化模型”的自我加速循环。 行业竞争焦点正从“谁最聪明”的单项性能比拼,转向为企业提供基于任务重要性、出错成本、规模等因素的“模型组合”最优解,追求整体ROI。这类似于云计算按数据冷热使用不同存储的策略。 OpenAI的长期战略日益清晰:其真正目标并非依靠单一模型的高毛利,而是通过极低的调用成本构建庞大的开发者生态与调用量,形成类似操作系统或云平台的渗透率与用户粘性。当API调用成本低至可被忽略,AI将如水电般无缝嵌入所有业务流程,其发展也将从追求智能巅峰的“产品时代”,进入驱动全面自动化与效率的“基础设施时代”。

marsbit1 小時前

OpenAI 不靠最贵的模型卖钱了

marsbit1 小時前

交易

現貨

熱門文章

什麼是 GROK AI

Grok AI: 在 Web3 時代革命性改變對話技術 介紹 在快速演變的人工智能領域,Grok AI 作為一個值得注意的項目脫穎而出,橋接了先進技術與用戶互動的領域。Grok AI 由 xAI 開發,該公司由著名企業家 Elon Musk 領導,旨在重新定義我們與人工智能的互動方式。隨著 Web3 運動的持續蓬勃發展,Grok AI 旨在利用對話 AI 的力量回答複雜的查詢,為用戶提供不僅具資訊性而且具娛樂性的體驗。 Grok AI 是什麼? Grok AI 是一個複雜的對話 AI 聊天機器人,旨在與用戶進行動態互動。與許多傳統 AI 系統不同,Grok AI 接納更廣泛的查詢,包括那些通常被視為不恰當或超出標準回應的問題。該項目的核心目標包括: 可靠推理:Grok AI 強調常識推理,根據上下文理解提供邏輯答案。 可擴展監督:整合工具協助確保用戶互動既受到監控又優化質量。 正式驗證:安全性至關重要;Grok AI 採用正式驗證方法來增強其輸出的可靠性。 長上下文理解:該 AI 模型在保留和回憶大量對話歷史方面表現出色,促進有意義且具上下文意識的討論。 對抗魯棒性:通過專注於改善其對操控或惡意輸入的防禦,Grok AI 旨在維護用戶互動的完整性。 總之,Grok AI 不僅僅是一個信息檢索設備;它是一個沉浸式的對話夥伴,鼓勵動態對話。 Grok AI 的創建者 Grok AI 的腦力來源無疑是 Elon Musk,這個名字與各個領域的創新息息相關,包括汽車、太空旅行和技術。在專注於以有益方式推進 AI 技術的 xAI 旗下,Musk 的願景旨在重塑對 AI 互動的理解。其領導力和基礎理念深受 Musk 推動技術邊界的承諾影響。 Grok AI 的投資者 雖然有關支持 Grok AI 的投資者的具體細節仍然有限,但公開承認 xAI 作為該項目的孵化器,主要由 Elon Musk 本人創立和支持。Musk 之前的企業和持股為 Grok AI 提供了強有力的支持,進一步增強了其可信度和增長潛力。然而,目前有關支持 Grok AI 的其他投資基金或組織的信息尚不易獲得,這標誌著未來潛在探索的領域。 Grok AI 如何運作? Grok AI 的運作機制與其概念框架一樣創新。該項目整合了幾種尖端技術,以促進其獨特的功能: 強大的基礎設施:Grok AI 使用 Kubernetes 進行容器編排,Rust 提供性能和安全性,JAX 用於高性能數值計算。這三者確保了聊天機器人的高效運行、有效擴展和及時服務用戶。 實時知識訪問:Grok AI 的一個顯著特點是其通過 X 平台(以前稱為 Twitter)訪問實時數據的能力。這一能力使 AI 能夠獲取最新信息,從而提供及時的答案和建議,而其他 AI 模型可能會錯過這些信息。 兩種互動模式:Grok AI 為用戶提供“趣味模式”和“常規模式”之間的選擇。趣味模式允許更具玩樂性和幽默感的互動風格,而常規模式則專注於提供精確和準確的回應。這種多樣性確保了根據不同用戶偏好量身定制的體驗。 總之,Grok AI 將性能與互動相結合,創造出既豐富又娛樂的體驗。 Grok AI 的時間線 Grok AI 的旅程標誌著反映其發展和部署階段的關鍵里程碑: 初始開發:Grok AI 的基礎階段持續了約兩個月,在此期間進行了模型的初步訓練和微調。 Grok-2 Beta 發布:在一個重要的進展中,Grok-2 beta 被宣布。這一版本推出了兩個版本的聊天機器人——Grok-2 和 Grok-2 mini,均具備聊天、編碼和推理的能力。 公眾訪問:在其 beta 開發之後,Grok AI 向 X 平台用戶開放。那些通過手機號碼驗證並活躍至少七天的帳戶可以訪問有限版本,使這項技術能夠接觸到更廣泛的受眾。 這一時間線概括了 Grok AI 從創建到公眾參與的系統性增長,強調其對持續改進和用戶互動的承諾。 Grok AI 的主要特點 Grok AI 包含幾個關鍵特點,促成其創新身份: 實時知識整合:訪問當前和相關信息使 Grok AI 與許多靜態模型區別開來,從而提供引人入勝和準確的用戶體驗。 多樣化的互動風格:通過提供不同的互動模式,Grok AI 滿足各種用戶偏好,邀請創造力和個性化的對話。 先進的技術基礎:利用 Kubernetes、Rust 和 JAX 為該項目提供了堅實的框架,以確保可靠性和最佳性能。 倫理話語考量:包含圖像生成功能展示了該項目的創新精神。然而,它也引發了有關版權和尊重可識別人物描繪的倫理考量——這是 AI 社區內持續討論的議題。 結論 作為對話 AI 領域的先驅,Grok AI 概括了數字時代轉變用戶體驗的潛力。由 xAI 開發,並受到 Elon Musk 願景的驅動,Grok AI 將實時知識與先進的互動能力相結合。它努力推動人工智能能夠達成的界限,同時保持對倫理考量和用戶安全的關注。 Grok AI 不僅體現了技術的進步,還體現了 Web3 環境中新對話範式的出現,承諾以靈活的知識和玩樂的互動吸引用戶。隨著該項目的持續演變,它成為技術、創造力和類人互動交匯處所能實現的見證。

1.1k 人學過發佈於 2024.12.26更新於 2024.12.26

什麼是 GROK AI

什麼是 ERC AI

Euruka Tech:$erc ai 及其在 Web3 中的雄心概述 介紹 在快速發展的區塊鏈技術和去中心化應用的環境中,新項目頻繁出現,每個項目都有其獨特的目標和方法論。其中一個項目是 Euruka Tech,該項目在加密貨幣和 Web3 的廣闊領域中運作。Euruka Tech 的主要焦點,特別是其代幣 $erc ai,是提供旨在利用去中心化技術日益增長的能力的創新解決方案。本文旨在提供 Euruka Tech 的全面概述,探索其目標、功能、創建者的身份、潛在投資者以及它在更廣泛的 Web3 背景中的重要性。 Euruka Tech, $erc ai 是什麼? Euruka Tech 被描述為一個利用 Web3 環境提供的工具和功能的項目,專注於在其運作中整合人工智能。雖然有關該項目框架的具體細節仍然有些模糊,但它旨在增強用戶參與度並自動化加密空間中的流程。該項目的目標是創建一個去中心化的生態系統,不僅促進交易,還通過人工智能整合預測功能,因此其代幣被命名為 $erc ai。其目的是提供一個直觀的平台,促進更智能的互動和高效的交易處理,並在不斷增長的 Web3 領域中發揮作用。 Euruka Tech, $erc ai 的創建者是誰? 目前,關於 Euruka Tech 背後的創建者或創始團隊的信息仍然不明確且有些模糊。這一數據的缺失引發了擔憂,因為了解團隊背景通常對於在區塊鏈行業建立信譽至關重要。因此,我們將這些信息歸類為 未知,直到具體細節在公共領域中公開。 Euruka Tech, $erc ai 的投資者是誰? 同樣,關於 Euruka Tech 項目的投資者或支持組織的識別在現有研究中並未明確提供。對於考慮參與 Euruka Tech 的潛在利益相關者或用戶來說,來自知名投資公司的財務合作或支持所帶來的保證是至關重要的。沒有關於投資關係的披露,很難對該項目的財務安全性或持久性得出全面的結論。根據所找到的信息,本節也處於 未知 的狀態。 Euruka Tech, $erc ai 如何運作? 儘管缺乏有關 Euruka Tech 的詳細技術規範,但考慮其創新雄心是至關重要的。該項目旨在利用人工智能的計算能力來自動化和增強加密貨幣環境中的用戶體驗。通過將 AI 與區塊鏈技術相結合,Euruka Tech 旨在提供自動交易、風險評估和個性化用戶界面等功能。 Euruka Tech 的創新本質在於其目標是創造用戶與去中心化網絡所提供的廣泛可能性之間的無縫連接。通過利用機器學習算法和 AI,它旨在減少首次用戶的挑戰,並簡化 Web3 框架內的交易體驗。AI 與區塊鏈之間的這種共生關係突顯了 $erc ai 代幣的重要性,成為傳統用戶界面與去中心化技術的先進能力之間的橋樑。 Euruka Tech, $erc ai 的時間線 不幸的是,由於目前有關 Euruka Tech 的信息有限,我們無法提供該項目旅程中主要發展或里程碑的詳細時間線。這條時間線通常對於描繪項目的演變和理解其增長軌跡至關重要,但目前尚不可用。隨著有關顯著事件、合作夥伴關係或功能添加的信息變得明顯,更新將無疑增強 Euruka Tech 在加密領域的可見性。 關於其他 “Eureka” 項目的澄清 值得注意的是,多個項目和公司與 “Eureka” 共享類似的名稱。研究已經識別出一些倡議,例如 NVIDIA Research 的 AI 代理,專注於使用生成方法教導機器人複雜任務,以及 Eureka Labs 和 Eureka AI,分別改善教育和客戶服務分析中的用戶體驗。然而,這些項目與 Euruka Tech 是不同的,不應與其目標或功能混淆。 結論 Euruka Tech 及其 $erc ai 代幣在 Web3 領域中代表了一個有前途但目前仍不明朗的參與者。儘管有關其創建者和投資者的細節仍未披露,但將人工智能與區塊鏈技術相結合的核心雄心仍然是關注的焦點。該項目在通過先進自動化促進用戶參與方面的獨特方法,可能會使其在 Web3 生態系統中脫穎而出。 隨著加密市場的持續演變,利益相關者應密切關注有關 Euruka Tech 的進展,因為文檔創新、合作夥伴關係或明確路線圖的發展可能在未來帶來重大機會。當前,我們期待更多實質性見解的出現,以揭示 Euruka Tech 的潛力及其在競爭激烈的加密市場中的地位。

939 人學過發佈於 2025.01.02更新於 2025.01.02

什麼是 ERC AI

什麼是 DUOLINGO AI

DUOLINGO AI:將語言學習與Web3及AI創新結合 在科技重塑教育的時代,人工智能(AI)和區塊鏈網絡的整合預示著語言學習的新前沿。進入DUOLINGO AI及其相關的加密貨幣$DUOLINGO AI。這個項目旨在將領先語言學習平台的教育優勢與去中心化的Web3技術的好處相結合。本文深入探討DUOLINGO AI的關鍵方面,探索其目標、技術框架、歷史發展和未來潛力,同時保持原始教育資源與這一獨立加密貨幣倡議之間的清晰區分。 DUOLINGO AI概述 DUOLINGO AI的核心目標是建立一個去中心化的環境,讓學習者可以通過實現語言能力的教育里程碑來獲得加密獎勵。通過應用智能合約,該項目旨在自動化技能驗證過程和代幣分配,遵循強調透明度和用戶擁有權的Web3原則。該模型與傳統的語言習得方法有所不同,重點依賴社區驅動的治理結構,讓代幣持有者能夠建議課程內容和獎勵分配的改進。 DUOLINGO AI的一些顯著目標包括: 遊戲化學習:該項目整合區塊鏈成就和非同質化代幣(NFT)來表示語言能力水平,通過引人入勝的數字獎勵來激發學習動機。 去中心化內容創建:它為教育者和語言愛好者提供了貢獻課程的途徑,促進了一個有利於所有貢獻者的收益共享模型。 AI驅動的個性化:通過採用先進的機器學習模型,DUOLINGO AI個性化課程以適應個別學習進度,類似於已建立平台中的自適應功能。 項目創建者與治理 截至2025年4月,$DUOLINGO AI背後的團隊仍然是化名的,這在去中心化的加密貨幣領域中是一種常見做法。這種匿名性旨在促進集體增長和利益相關者的參與,而不是專注於個別開發者。部署在Solana區塊鏈上的智能合約註明了開發者的錢包地址,這表明對於交易的透明度的承諾,儘管創建者的身份未知。 根據其路線圖,DUOLINGO AI旨在演變為去中心化自治組織(DAO)。這種治理結構允許代幣持有者對關鍵問題進行投票,例如功能實施和財庫分配。這一模型與各種去中心化應用中社區賦權的精神相一致,強調集體決策的重要性。 投資者與戰略夥伴關係 目前,沒有與$DUOLINGO AI相關的公開可識別的機構投資者或風險投資家。相反,該項目的流動性主要來自去中心化交易所(DEX),這與傳統教育科技公司的資金策略形成鮮明對比。這種草根模型表明了一種社區驅動的方法,反映了該項目對去中心化的承諾。 在其白皮書中,DUOLINGO AI提到與未具名的「區塊鏈教育平台」建立合作,以豐富其課程提供。雖然具體的合作夥伴尚未披露,但這些合作努力暗示了一種將區塊鏈創新與教育倡議相結合的策略,擴大了對多樣化學習途徑的訪問和用戶參與。 技術架構 AI整合 DUOLINGO AI整合了兩個主要的AI驅動組件,以增強其教育產品: 自適應學習引擎:這個複雜的引擎從用戶互動中學習,類似於主要教育平台的專有模型。它動態調整課程難度,以應對特定學習者的挑戰,通過針對性的練習加強薄弱環節。 對話代理:通過使用基於GPT-4的聊天機器人,DUOLINGO AI為用戶提供了一個參與模擬對話的平台,促進更互動和實用的語言學習體驗。 區塊鏈基礎設施 建立在Solana區塊鏈上的$DUOLINGO AI利用了一個全面的技術框架,包括: 技能驗證智能合約:此功能自動向成功通過能力測試的用戶頒發代幣,加強了對真實學習成果的激勵結構。 NFT徽章:這些數字代幣標誌著學習者達成的各種里程碑,例如完成課程的一部分或掌握特定技能,允許他們以數字方式交易或展示自己的成就。 DAO治理:持有代幣的社區成員可以通過對關鍵提案進行投票來參與治理,促進一種鼓勵課程提供和平台功能創新的參與文化。 歷史時間線 2022–2023:概念化 DUOLINGO AI的基礎工作始於白皮書的創建,強調了語言學習中的AI進步與區塊鏈技術去中心化潛力之間的協同作用。 2024:Beta發佈 限量的Beta版本推出了流行語言的課程,作為項目社區參與策略的一部分,獎勵早期用戶以代幣激勵。 2025:DAO過渡 在4月,進行了完整的主網發佈,並開始流通代幣,促使社區討論可能擴展到亞洲語言和其他課程開發的問題。 挑戰與未來方向 技術障礙 儘管有雄心勃勃的目標,DUOLINGO AI面臨著重大挑戰。可擴展性仍然是一個持續的擔憂,特別是在平衡與AI處理相關的成本和維持響應靈敏的去中心化網絡方面。此外,在去中心化的提供中確保內容創建和審核的質量,對於維持教育標準來說也帶來了複雜性。 戰略機會 展望未來,DUOLINGO AI有潛力利用與學術機構的微證書合作,提供區塊鏈驗證的語言技能認證。此外,跨鏈擴展可能使該項目能夠接觸到更廣泛的用戶基礎和其他區塊鏈生態系統,增強其互操作性和覆蓋範圍。 結論 DUOLINGO AI代表了人工智能和區塊鏈技術的創新融合,為傳統語言學習系統提供了一種以社區為中心的替代方案。儘管其化名開發和新興經濟模型帶來某些風險,但該項目對遊戲化學習、個性化教育和去中心化治理的承諾為Web3領域的教育技術指明了前進的道路。隨著AI的持續進步和區塊鏈生態系統的演變,像DUOLINGO AI這樣的倡議可能會重新定義用戶與語言教育的互動方式,賦能社區並通過創新的學習機制獎勵參與。

964 人學過發佈於 2025.04.11更新於 2025.04.11

什麼是 DUOLINGO AI

相關討論

歡迎來到 HTX 社群。在這裡,您可以了解最新的平台發展動態並獲得專業的市場意見。 以下是用戶對 AI (AI)幣價的意見。

活动图片