Agent已进入Harness驱动时代

marsbit发布于2026-04-15更新于2026-04-15

文章摘要

近日，Anthropic公司意外泄露了其AI编程工具Claude Code的源代码，总量超过51.2万行。虽然未包含颠覆性算法，但完整展示了其Agent工程实践的核心架构——Harness系统。Harness可理解为驱动模型的整套工程架构，其核心作用在于最大化模型能力，而不仅是输出文本。 Claude Code的Harness系统包含六大核心组件：多层级系统提示（System Prompt）、工具规范（Tool Schema）、工具调用循环（Tool Call Loop）、上下文管理器（Context Manager）、子智能体（Sub Agent）和验证钩子（Verification Hooks）。这些组件共同实现了模型行为的精准控制、工具调用与执行的一体化、上下文高效管理、多智能体协同及结果客观验证。 Harness架构将训练与推理环境深度融合，推动后训练（Post-training）朝六大方向发展：系统提示驱动行为对齐、长链路工具调用端到端训练、规划与执行一体化训练、记忆压缩专项训练、子智能体协同编排训练，以及多目标联合强化学习。这一转变意味着行业需求正从纯模型能力转向工程架构与系统整合。复合型人才（兼具AI、工程与架构能力）将更受青睐，而“模型外壳公司”生存空间收窄，必须依靠顶尖基础设施或垂直领域壁垒。Agent落地更强调私有化、高安全与端到端一体化，企业应优先复用成熟Harness设计，结合场景做定制，以实现真正规模化应用。

文 | 霞光AI实验室

近日,AI技术圈一个热议的话题是,Anthropic公司意外暴露了旗下AI编程工具Claude Code的完整源代码,代码数量超过51.2万行。这些泄露的代码虽未展示了颠覆性新算法,却完整暴露了头部厂商的Agent工程实践。

4月10日,Pokee.ai创始人朱哲清做客由锦秋基金发起的“Deep Talk with Builders”的线上闭门,分享了“从Claude Code的泄漏看Harness Engineering和当下Post-training”的话题。

他认为,Anthropic这套架构高度适配Claude模型,而直接迁移到其他模型效果会显著下降,但其Harness设计思想、组件化结构、与后训练(Post-training)深度绑定的思路,对自研Agent具有极强的借鉴价值。

过去三年,大模型从单纯API能力,进化为产品核心模块;行业也从“模型外壳公司”,走向Harness驱动的复杂Agent系统——模型不再是唯一核心,工具调用、执行环境、上下文管理、验证机制共同决定最终效果。

Harness是什么?它直译是马具,缰绳。如果说大模型是一匹蓄势待发的烈马,Harness就是人类牵引、驾驭这匹烈马的缰绳。随着人工智能正式进入Harness驱动的时代,对于使用者来说,真正稀缺的能力,不在模型里面,在模型外面——如何找到一副趁手的缰绳,以及驾驶者心中清晰准确的目的地。

本文基于朱哲清的分享内容,经AI总结梳理,并人工校对,力求呈现这次分享的精华内容。

Harness可理解为驱动模型的整套工程架构,它的核心作用是把模型能力最大化,而非单纯输出tokens。Claude Code的Harness清晰拆解为六大核心组件:

1. 多层级System Prompt(系统提示)

现代System Prompt已远不止“你是一个有用的助手”,而是超大规模、分层、可缓存的复杂指令集:

固定缓存部分:包含Agent身份、Co指令、工具定义、语气规范、安全策略,大小可达十几万token,任何改动都会失效缓存、大幅增加成本与耗时;
动态可替换部分:会话状态、当前时间、可读取文件、代码包依赖等,随任务灵活切换;
工程实践:通过A/B test对不同用户微调Prompt,精准优化任务完成率、降低错误率。

对比来看,Claude Code的架构更简洁,模型注意力负担更低、幻觉更少;而OpenAI相关架构更复杂,需读取大量文件,易引发记忆幻觉。

2. Tool Schema(工具规范)

工具定义直接决定调用准确率,核心设计要点:

内置核心工具:文件读写/编辑、Bash、Web批处理等基础工具在模型训练阶段就完成适配,推理时无需额外提供工具描述;
权限与安全:企业级场景拒绝第三方无权限校验的工具,避免恶意操作;
并行工具调用:可提升执行速度,但后训练难度极高——并行调用无先后依赖,训练时易出现时序错位,Reward信号难以对齐。

3. Tool Call Loop(工具调用循环)

这是Harness最核心部分,也是训练与推理一体化的关键:

规划模式(Plan Mode):长链路任务先理解任务、梳理文件系统、明确可用工具,生成执行方案,再进入执行;避免盲目试错(如反复调用不可用搜索引擎)、减少无效token消耗;
执行模式(Execute Mode):在沙盒(Sandbox)中按规划执行工具,获取结果闭环;
核心价值:消除长链路执行中的中间错误,降低重试成本,但也让规划能力的训练更难——规划好坏的Reward信号易被执行环节噪声干扰。

4. Context Manager(上下文管理器)

解决百万级token上下文的高效利用问题:

采用指针索引式Memory:不直接存储完整内容,仅记录文件指针与主题标签;
后台自动合并、去重、关联文件;
现状:仍处于启发式阶段,无法完美解决多文件跨链路推理问题(如关联文件被遗漏),暂无端到端最优解。

5. Sub Agent(子智能体)

主流多智能体协作缺乏理论保障:无共享目标、无通用训练算法,只能“各自训练、随缘配合”。

而主-子Agent架构本质是分层强化学习:

主Agent为子Agent定义子任务(Option),子任务终结状态作为主Agent下一步起点;
共享KV Cache与输入上下文,子Agent执行后仅追加结果,不额外增加token消耗,成本远低于串行执行;
典型落地:字节ContextFormer等工作思路与此高度一致。

6. Verification Hooks(验证钩子)

解决模型“自我美化、虚报完成”的问题:

强模型存在自我偏好,自评准确率远高于互评,易主动“说谎”而非单纯幻觉;
工程方案:引入后台分类器,只看工具执行结果、忽略模型生成文本,脱离生成偏差做客观校验;
作用:无需完全可验证的Reward,即可实现轻量化、优雅的执行结果校验。

传统RL(强化学习)训练环境与推理环境严重割裂,而Harness实现了训练-生产环境的一体化:工具调用序列=轨迹步,测试运行与分类闸门=Reward信号,用户任务=完整Episode。

围绕上述六大组件,Post-training(后训练)形成六大核心方向:

1. System Prompt(系统提示词)驱动行为对齐

System Prompt 会明确任务目标、Token 预算与可用工具策略,从而大幅约束模型的行为空间,让强化学习只需在限定范围内学习最优执行模式。我们可以基于 System Prompt 中的规则设计评分体系,让模型在更干净、更少分支的轨迹下进行近似端到端训练,稳定输出符合预期的行为。

2. 长链路工具调用端到端训练

抛弃传统“单步快照式训练”,改为完整轨迹训练:

记录每一步执行结果,获取过程Reward与最终任务Reward;
聚焦长链路稳定性,保证几百步工具调用的整体准确率,而非仅单步调用正确。

3. Plan-Execute一体化训练

Harness消除规划与执行间的噪声:

预先锁定规划中的工具链路,无额外人工干预层;
执行结果由分类闸门客观校验,规划的Reward信号更清晰;
实现规划能力可训练,避免“只执行、不规划”的粗放模式。

4. Memory Compression专项训练

将上下文压缩作为独立任务:上游模型输出压缩记忆,下游任务执行效果作为校验标准;目标是保留核心信息,不影响下游任务成功率。

5. 子Agent协同编排训练

针对超长输出(代码/文档百万token场景):

主Agent不直接生成内容,而是编排子Agent,分配任务与Prompt;
子Agent并行执行后合并结果,主Agent做校验;
依赖Harness实现底层进程控制,避免读写冲突与执行失败。

6. 多目标联合强化学习

现代RL pipeline大幅延长,需同时优化六大模块:

工具调用无幻觉、分类校验准确、上下文压缩有效、多Agent无掣肘、规划合理、验证可信;
行业从算法收敛走向百花齐放,各环节需专属训练算法,多目标融合成为核心难题。

首先是人才需求的转变。Prompt Engineering已不再是独立核心,做好Harness可完成70%工作。因此,兼具AI理解、后端工程、基础设施能力的复合型人才将会更受欢迎,而纯Prompt工程师竞争力则会大幅下降。

其次是市场格局的重构。在模型厂商与垂直领域企业挤压下,中间“模型外壳公司”,仅剩两条可行路径,要么拥有顶尖模型与基础设施能力,要么在垂直领域独有数据/经验壁垒(如高频交易、行业专属知识)。

第三,真正的Agent落地正走向私有化、高安全、端到端一体化。对于企业来说,优先复用成熟Harness设计,结合垂直场景做定制化,聚焦安全与私有化落地,才能实现Agent真正规模化商用。

Claude Code泄露的核心价值,不在于代码本身,而在于揭示了Agent已进入Harness驱动时代。模型能力只是基础,工程架构、执行环境、多智能体协同、验证机制才是决定上限的关键。

你可能也喜欢

因Coldcard遭黑客攻击，近期比特币钱包最大规模被盗事件引发新一轮损失！损失持续攀升

Galaxy Research报告称，针对Coldcard硬件钱包的第三波攻击已发生，此次造成207.7294 BTC损失，使总损失增至约1367.05 BTC（约8860万美元），涉及4585个地址。前两波攻击在区块链行为上相似，疑似同一攻击者所为，但第三波在多个可测特征上显著不同：它为每个受害者创建独立地址、针对P2WSH而非P2WPKH地址、平均每次汇入6.37个受害地址，且仅扫描标准派生路径。这些差异可能是原攻击者升级工具以混淆追踪，也可能是漏洞公开后出现了新的攻击者。目前，被盗BTC仍存放在攻击者地址中未转移。分析显示，损失地址多为余额低于1 BTC的个人钱包，但大余额地址贡献了主要损失金额。存在漏洞的Coldcard固件发布于2021年3月17日，所有被盗BTC均在此后生成。

cryptonews.ru44分钟前

因Coldcard遭黑客攻击，近期比特币钱包最大规模被盗事件引发新一轮损失！损失持续攀升

cryptonews.ru44分钟前

特朗普媒体再抛售2628枚BTC，持有量降至4261枚

特朗普媒体与科技集团再度出售2,628枚比特币，价值约1.65亿美元，将其比特币持仓减少至4,261枚，当前价值约2.698亿美元。据区块链数据分析，该公司在过去七个月内已累计出售7,281枚比特币，总价值约5.45亿美元，平均出售价格为每枚74,855美元。此次出售正值与特朗普相关的加密业务面临更广泛的伦理审查之际，美国立法者正在审议《数字资产市场清晰法案》，该法案涉及公职人员数字资产所有权的道德规则与潜在利益冲突。批评者指出，特朗普相关的加密项目，包括特朗普和梅拉尼娅主题 meme 币，凸显了政治影响力与私人加密利益之间的重叠问题。

cointelegraph1小时前

cointelegraph1小时前

福建晋江，一家存储超级独角兽静悄悄

近日，随着长鑫科技A股上市成为股王，同为国内三大存储芯片项目之一的福建晋华集成电路有限公司（晋华）重新进入公众视野。这家位于福建晋江的DRAM企业，自2016年成立起便肩负打破海外垄断的使命，却因2018年被美国列入实体清单并遭遇司法指控而陷入长达数年的沉寂。2024年2月，美国法院裁定其无罪，晋华才得以摆脱法律阴影。晋华的曲折发展与灵魂人物陈正坤密不可分。这位拥有美光与联电背景的工程师，怀揣自主开发DRAM的梦想加入晋华。公司初期通过与联电合作快速推进，但随后美光发起诉讼，指控技术窃密，导致晋华产线因设备禁运而停摆。在极端困难下，陈正坤带领团队改造国产设备、重构工艺，艰难维持运营。尽管最终赢得清白，但发展进度已被严重拖慢。目前，晋华专注于利基型DRAM市场，月产能约4万片，拥有千余项专利，但仍在美国实体清单限制之下。晋江这座以鞋服闻名的民营经济强市，为引入晋华这一“硬科技”项目投入巨资，并以政府基金、全链条配套和持续的政策支持，助力企业在制裁中生存下来。如今，以晋华为龙头，晋江已形成超千亿规模的集成电路产业集群。在全球AI驱动存储繁荣的周期中，晋华虽规模尚小，但其在封锁中重建的经历，已成为中国存储产业自主攻坚的缩影。

marsbit1小时前

marsbit1小时前

38GW电力缺口下，比特币矿场为何突然成了AI算力的新入口？

当AI数据中心竞争的核心转向电力资源时，曾经高度依赖电力的比特币矿场正凭借其现成的电网接入、土地和电力设施，转型为AI算力基础设施供应商。摩根士丹利预测，美国2026-2028年数据中心电力缺口可能高达38GW，而改造旧矿场有望贡献10-19GW的容量。一批北美上市矿企，如TeraWulf、Hut 8等，正从“挖矿”转向成为“带电机房壳体提供商”。它们不再只是出售算力，而是向云厂商和AI公司提供已具备电力、土地和基础建筑的场地，帮助客户更快地部署大规模算力。这一转型的关键在于，获取新的电网接入许可可能需要等待5-7年，而现成矿场所拥有的已获批电力容量变得极其稀缺。因此，旧矿场的核心价值正从生产比特币，转变为提供通往AI算力的“电力入口”，其资产价值面临重估。

华尔街日报1小时前

华尔街日报1小时前

迈克尔·塞勒："我们从未说过永远不会出售比特币"

微策略公司主席迈克尔·塞勒表示，公司从未承诺永不卖出其持有的比特币，但预计在长期内仍将保持比特币的净买家身份。此番言论是针对有报道称微策略新获准出售最多价值50亿美元比特币的回应。塞勒澄清，该出售许可并非新消息，而是公司早在6月29日就已公布的资本管理体系的一部分。他指出，相关许可是为了特定目的而设，但并未强制公司必须出售比特币。他强调，公司没有宣布任何新的许可，且预期未来将继续净买入比特币。塞勒还说明，公司的比特币货币化计划并不要求出售比特币资产，并重申公司从未正式采纳“永不卖出比特币”的政策。

cryptonews.ru2小时前

cryptonews.ru2小时前

交易

现货

Agent已进入Harness驱动时代

文章摘要

热门币种推荐

相关问答

你可能也喜欢

因Coldcard遭黑客攻击，近期比特币钱包最大规模被盗事件引发新一轮损失！损失持续攀升

特朗普媒体再抛售2628枚BTC，持有量降至4261枚

福建晋江，一家存储超级独角兽静悄悄

38GW电力缺口下，比特币矿场为何突然成了AI算力的新入口？

迈克尔·塞勒："我们从未说过永远不会出售比特币"

交易

热门文章

如何购买ERA

相关讨论

热门问答

热门分类

热门标签