OpenAI高管:Codex这样的Harness,也就再火俩月

marsbit發佈於 2026-08-09更新於 2026-08-09

文章摘要

OpenAI产品兼平台总经理Thibault Sottiaux近期表示,以Codex为代表的“Harness”(大模型配套管理工具)生命周期可能仅剩2-3个月,将很快变成“原始工具”。 当前,Harness框架帮助用户通过本地电脑(如笔记本)运行AI智能体(Agent),实现任务自动化。但Sottiaux指出,这种方式在面临下一代强大模型时将遇到根本瓶颈:本地算力与内存不足、长时任务要求设备永不关机、难以处理大规模并发任务与复杂上下文管理。 因此,AI智能体的运行范式正在从“本地单机工具”向“云原生基础设施”演进。趋势包括: 1. **云端异步执行**:如Codex已支持将任务发送到云端容器运行,设备仅作为指挥终端。 2. **云原生微沙箱兴起**:出现专门为AI Agent设计的云端沙箱环境,可动态创建大量独立容器并行处理任务。 3. **研发重心转移**:顶尖AI团队正从优化提示词转向构建“系统级Harness”,专注于打造环境、测试闭环与反馈基础设施。例如Anthropic曾用16个Claude实例在2000个云端会话中协同编写了一个C语言编译器。 未来智能体工作流将呈现“本地轻指挥,云端重执行”的标配模式。开发界面将成为操控板,计算密集型任务全部在云端集群中并行完成。竞争焦点也将从“模型推理能力”转向“模型潜力释放程度”,仅依赖本地简单调用的Agent框架即将触顶。

「再过 2-3 个月,Codex 就是个原始工具了。」

这话不是竞争对手说的,是现任 OpenAI 产品兼平台总经理,负责 ChatGPT、Codex 的 Thibault Sottiaux 自己跑出来说的。

最近,Harness 框架已经逐渐破圈。从开发者到白领,人们纷纷用上了这种 Agent 工具,享受到了 AI 带来的自动化红利。在这其中,OpenAI 的 Codex 更是佼佼者。

然而在这个节点上,OpenAI 的高管已经看到了更远处。AI 智能体(Agent)的下一步,或许还有一个从单机小工具向「云原生基础设施」演进的范式进化。

Thibault Sottiaux 所说的「笔记本不够用了」意思很明确:我们正在用单机 Harness 去驱动有长时推理和高度自主能力的下一代模型,这种「小脚穿大鞋」的模式已经快玩不下去了。

我们知道,所谓 Harness 是指围绕大模型构建的上下文管理、工具调用、状态持久化、环境隔离和异常恢复等套件。目前很多开发者都是以在笔记本电脑上运行 Agent(如通过 CLI、Cursor、Claude Code 或轻量 Agent 逻辑)的方式来完成任务的。

当然越来越多的开发者也倾向于多工具、多模型一起用:比如用 Claude Code 上的 Fable 5 来写项目文档,再去 Codex 上用其他模型来执行。

但这在面对下一代前沿模型时会碰到三大物理瓶颈:

算力、内存局限:当智能体需要并发执行 20 个子任务(如一边跑测试、一边爬数据、一边编译大项目),本地笔记本的内存、CPU 以及并发沙箱(Docker/VM)资源会瞬间爆满。

长任务无法关机:复杂的 Agent 任务可能需要运行几小时甚至几天,要求用户的笔记本不能关机、不能断网、不能合盖,这在工程上非常反人性。

上下文与工具链的并行爆炸:下一代模型肯定将支持极长上下文和高度并发推理。本地轻量级 Harness 将会很难处理大规模并发 Agent 之间的上下文压缩、状态同步与集中式日志追踪。

面对这些挑战,Agent 工具向重型基础设施和系统设计转型的迹象,其实已经在过去几个月里逐渐出现。

比如 OpenAI 的 Codex 目前已经提供云端异步运行支持。用户在终端下达指令后,任务被丢进云端隔离的容器(Sandbox Container)里自治运行,手机或笔记本只起一个指挥控制的作用。

与此同时,云原生微沙箱正在兴起:像 E2B、Daytona、Fly.io、Modal 等专为 AI Agent 设计的云端极速沙箱基础设施,可以让 Agent 在执行任务时动态弹起数百个独立容器环境去平行跑代码和验证结果。

在包括 OpenAI、Anthropic、Cognition 等顶尖 AI 团队中间,工程师们正在开始将研发的重点从优化 Prompt 转移到「编写系统级的 Harness」。

今年 2 月,Anthropic 团队展示过用 16 个 Claude 并行运行在 2000 个云端 Session 中写出一个 C 语言编译器的案例。这是生成式 AI 在软件工程领域走向多 Agent 协同的一个里程碑。其中,不同的 Claude 实例扮演了不同角色:1 个架构师 Agent 负责设计抽象语法树(AST),4 个编码 Agent 负责不同模块,两个测试 Agent 专门写单元测试,1 个审计 Agent 负责 Review 代码流和安全性。

主导研究员 Nicholas Carlini 指出:「大部分精力都花在了为模型打造环境、测试闭环与反馈基础设施上。」

未来两到三个月,这样的智能体工作流可能会成为我们的日常。

结合 Thibault Sottiaux 的判断,「本地轻指挥,云端重执行」将会成为标配,开发者界面(如 IDE、Terminal、Web UI)将彻底变为操控板。真正的代码重构、测试跑通、浏览器自动化模拟等计算密集任务,全部会在云端动态集群中并行消化,再将最终差异(Diff)和日志流式推回本地。

而模型与 Harness 的深度结合,或许会把竞争从「比谁的模型推理能力更强」,转变成「比谁的模型潜力释放得更彻底」。那些只靠在本地电脑跑 Python 脚本和简单 API 调用的 Agent 框架,即将全面触顶。

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:泽南

相關問答

Q根据OpenAI高管Thibault Sottiaux的观点,为什么他认为Codex等Harness工具的现有形式即将过时?

A他认为再过2-3个月,像Codex这样的Harness工具就将成为‘原始工具’。原因在于,当前主要在本地(如笔记本电脑上)运行的Harness框架在处理下一代需要长时推理和高度自主能力的AI模型时,将遇到算力与内存局限、长任务无法关机以及并行处理能力不足三大物理瓶颈,这种‘小脚穿大鞋’的模式已难以持续。

Q文章中提到AI Agent(智能体)的未来发展趋势是什么?

AAI Agent的未来发展趋势是从‘单机小工具’向‘云原生基础设施’演进。未来的模式将是‘本地轻指挥,云端重执行’,复杂的计算密集任务(如代码重构、测试、自动化模拟)会在云端的动态集群中并行执行,本地设备(如IDE、终端)则主要作为操控板来下达指令和接收结果。

Q为了解决当前Harness框架的瓶颈,业界出现了哪些相关的技术或基础设施?

A为了解决瓶颈,业界出现了以下几种技术或基础设施:1. 云端异步运行支持(如OpenAI Codex已提供的功能),任务在云端隔离容器中运行;2. 云原生微沙箱,例如E2B、Daytona、Fly.io、Modal等专为AI Agent设计的云端极速沙箱基础设施,可以动态弹起大量独立容器并行执行任务;3. 系统级的Harness设计,工程师的工作重点从优化提示词转向构建能管理多Agent协同、状态持久化等复杂工作流的基础设施。

Q文章中以Anthropic团队的案例说明了什么?

A文章中以Anthropic团队展示的案例说明了生成式AI在软件工程领域正走向成熟的多Agent协同。他们用16个Claude实例并行运行在2000个云端会话中,协作编写了一个C语言编译器。这个案例是一个里程碑,它展示了不同AI Agent可以扮演架构师、编码员、测试员、审计员等不同角色进行分工合作,并且研发重点在于为模型打造环境、测试闭环与反馈基础设施,而不仅仅是模型本身。

Q随着AI智能体的演进,未来的竞争焦点可能发生什么变化?

A未来的竞争焦点可能会从单纯比较‘谁的模型推理能力更强’,转变为比较‘谁的模型潜力释放得更彻底’。这意味着,能够更有效地通过先进的云原生基础设施和系统级Harness来管理和驱动AI模型,使其充分发挥长上下文、高度并发和自主协同能力的公司或产品,将获得竞争优势。而那些仅依赖于本地简单API调用的Agent框架将很快触及能力天花板。

你可能也喜歡

2万亿美元,AI史上最大IPO进入倒计时

AI公司Anthropic预计将于今年十月进行IPO,估值可能突破2万亿美元,这将是史上最大规模的AI公司上市。其估值由六位投资人根据模型推算得出,其中有人甚至预估超过3万亿美元。公司内部对此并未设定明确目标。 Anthropic在短短五年内实现了惊人增长,从初创公司迅速跻身巨头行列。2025年底年化收入约90亿美元,到2026年5月已飙升至470亿美元,第二季度营收达115亿美元,同比激增14倍。内部预测,到2028年营收可能达到1900亿至2000亿美元。 公司收入主要依靠API和企业合同,按调用量计费,其中编程辅助工具Claude Code是增长核心,贡献近两成收入,在企业和开发者中广泛使用。 然而,公司内部正面临文化撕裂。CEO达里奥·阿莫代伊及其核心团队带有强烈的“拯救人类”使命感,被部分员工形容为“祭司阶层”,其管理风格引发基层员工不满,甚至出现了秘密的吐槽网络。员工在即将到来的财富自由与压抑的工作环境之间陷入挣扎。 Anthropic目前处境微妙:追求最安全的AI需要巨额算力投入,而这又依赖于资本市场支持,迫使公司在理想与商业现实间寻找平衡。其IPO前景虽被看好,但SpaceX上市后股价大跌的前例,以及监管、成本和内部治理等挑战,都为其未来增添了不确定性。

marsbit2 小時前

2万亿美元,AI史上最大IPO进入倒计时

marsbit2 小時前

降本增效的AI,让VC越来越烧钱

《降本增效的AI,让VC越来越烧钱》一文指出,尽管AI技术降低了创业公司的部分运营和开发成本,却推高了风险投资(VC)获取优质AI公司股权的价格。AI领域融资呈现“杠铃型”结构:一方面,普通初创企业融资规模趋于小额化;另一方面,顶尖团队(如来自OpenAI、Google DeepMind的核心人员)的早期项目估值急剧膨胀,数亿甚至上百亿美元的融资与估值在成立初期便已出现。 这种趋势导致VC持股成本显著上升。早期估值飙升的同时,创始人让渡的股权比例并未同步增加,使得VC为维持相同持股比例所需投入的资金大幅增加。为此,大型风投机构(如Accel、a16z)纷纷募集更大规模的基金,以覆盖从早期进入到后期跟投的全周期,确保在头部项目竞争中不落下风。 资金进一步向少数头部AI项目集中。2026年上半年,全球超70%的创业融资流向AI公司,其中OpenAI和Anthropic两家就占据了全球创业融资总额的43%。这种集中化加剧了VC行业的马太效应,大型基金凭借资金优势持续加码潜在赢家,而小型基金参与热门项目的能力受到削弱。 然而,高估值已提前计入了未来增长预期。若企业最终无法实现与估值匹配的商业化规模,投资回报将面临压缩。目前,许多基金的账面收益仍依赖后续融资的估值重估,而非实际退出。对大型VC而言,当下的核心策略已转变为:在技术“超级周期”中尽早押注潜在龙头,并为伴随估值飙升的持续跟投储备充足弹药。AI降低了创业门槛,却让投资优质AI公司的成本变得愈发昂贵。

marsbit2 小時前

降本增效的AI,让VC越来越烧钱

marsbit2 小時前

八年投入急转弯,以太坊为何突然放弃Poseidon?

以太坊基金会研究员Justin Drake近日宣布,以太坊将在Layer 1层放弃已研发八年的SNARK友好型哈希算法Poseidon,转而采用SHA2或BLAKE2等传统哈希函数。这一重大转向源于后量子密码学研究的突破性进展。 Poseidon自2019年起因其在零知识证明电路中的高效性,被广泛用于zkRollup等应用。但其算法历史较短,密码学分析时间不足。而随着后量子安全成为硬性要求,其局限性显现。最新的SNARK设计,特别是基于“二进制域”的证明系统(如Binius和Flock),已能高效处理传统哈希函数的布尔运算,使得SHA2等成熟算法在证明性能上可媲美甚至超越Poseidon,消除了采用后者的主要优势。 另一关键因素是应对量子计算威胁的时间表正在加速。报告预测“量子破译日”可能在本世纪30年代初到来,将对区块链资产构成巨大风险。以太坊因此需要尽快采用经过长期密码分析验证的、抗量子攻击能力更强的哈希方案。其后续量子路线图计划于2027年推出核心构件leanVM,并在2028年完成共识层、执行层和数据层的部署。 与此同时,其他公链如Solana已选定后量子签名方案Falcon,而StarkNet也计划采用BLAKE2等算法。以太坊此次转向,标志着技术重点从“设计SNARK友好型哈希”转变为“设计哈希友好型SNARK”,是在后量子时代选择更成熟、更稳健的密码学基元的战略调整。

marsbit4 小時前

八年投入急转弯,以太坊为何突然放弃Poseidon?

marsbit4 小時前

交易

現貨
活动图片