Anthropic 数据:AI Agent 近半调用集中在软件工程,这 16 个垂域仍是蓝海

marsbit发布于2026-02-24更新于2026-02-24

文章摘要

Anthropic最新研究显示,近50%的AI Agent工具调用集中在软件工程领域,而医疗、法律、教育等16个垂直领域的应用占比均不足5%,市场仍处于蓝海状态。尽管AI模型已能独立处理近5小时的任务,用户实际平均使用时长仅42分钟,存在显著的“信任赤字”,这为产品创新提供了机会。 研究发现,用户随着使用经验积累,会从逐步审批转向主动监控,但干预频率反而上升。Anthropic强调,自主权是由模型、用户和产品共同构建的,强制审批每个操作会降低效率而非提升安全性。 Box创始人指出,垂直AI的成功需结合领域专业知识、专有数据和变更管理能力,未来十年可能涌现300家垂直AI独角兽,取代的不仅是软件,还包括操作人员。目前,高风险操作占比极低,安全性可控。

作者:Garry's List

编译:深潮 TechFlow

深潮导读:Anthropic 最新发布了迄今最全面的 AI Agent 真实使用研究,核心数据是:软件工程占据近 50% 的 Agent 工具调用量,而医疗、法律、教育等 16 个垂直领域加起来还不到剩余的一半,每个领域份额均低于 5%。

这不是市场饱和的信号,而是 300 个垂直 AI 独角兽的地图——更有价值的是文章引用的一个反直觉发现:模型已经能独立工作近 5 小时,但用户实际只让它工作 42 分钟,这个"信任赤字"本身就是下一个产品机会。

全文如下:

软件工程占所有 AI Agent 工具调用量的近 50%。医疗、法律、金融等 16 个垂直领域几乎未被触及,每个领域均低于 5%。这意味着有 300 个垂直 AI 独角兽等待被建造出来。

如果我今天要创业,我会盯着上面那张柱状图的红色区域,直到我看见自己的未来。

Box 创始人 Aaron Levie 表示:

这张图很好地提醒了我们,AI Agent 领域现在有多大的机会。

水平方向当然会有大量 Agent 机会,但同样有很多工作流需要深厚的领域专业知识,才能真正帮助用户自动化其所在垂直领域的独特流程。

模板是:构建接入专有数据的 Agent 软件,以有效衔接用户与 Agent 协作的方式处理工作流,同时具备深度领域专属的上下文工程能力,以及推动客户侧变更管理的能力。

目前许多领域仍存在巨大空白。

软件工程占据了所有 AI Agent 活动的半壁江山。另一半分散在 16 个垂直领域,没有一个超过 9%。医疗占 1%,法律占 0.9%,教育占 1.8%。这些不是饱和市场,而是几乎还不存在的市场。

Anthropic 刚刚发布了迄今最全面的 AI Agent 真实使用研究。核心发现是:软件工程占其 API 上 49.7%的 Agent 工具调用量。被埋在后面的核心结论是:其他一切都是蓝海。

部署滞后

有一个数据应该让创业者兴奋不已:模型的能力已经远超用户愿意信任它的边界。

METR 的能力评估显示,Claude 可以解决需要人类近五小时才能完成的任务。但在实际使用中,第 99.9 百分位的会话时长只有约 42 分钟。这个差距——AI 能做什么与我们允许它做什么之间的差距——是一个巨大的机会。

图:Claude Code 训练的最长时长在三个月内几乎翻了一番。这不仅提升了能力,也增强了信任。

来源:x.com

从 2025 年 10 月到 2026 年 1 月,第 99.9 百分位的单次会话时长几乎翻了一倍,从不足 25 分钟增长至超过 45 分钟。增长在各个模型版本间都很平稳。这不只是模型变得更强了,而是用户一次次地在使用中学习,逐渐延伸着对 Agent 的信任。

"从 8 月到 12 月,Claude Code 在内部用户最具挑战性任务上的成功率翻了一倍,与此同时,每次会话的人工干预次数从 5.4 次减少到 3.3 次。"

能力已经在那里,部署还没跟上。这不是问题,而是产品机会。

信任是如何演化的

新用户中有 20%会自动批准 Claude Code 的操作。到 750 次会话时,超过 40%的会话完全在自动批准模式下运行。但有一个反直觉的发现:有经验的用户反而会更多地进行干预,而不是更少。新用户会在 5%的轮次中进行干预,老用户则是 9%。

图:信任是一种会不断积累的技能。新用户会自动批准 20% 的会话。到 750 次会话时,这一比例会超过 40%。

图片:Anthropic

来源: x.com

这并不矛盾,而是监督策略的转变。初学者在操作发生前逐步审批,老用户则是先授权、在出问题时再介入——他们已经从预先审批转向了主动监控。

以下是一个在安全层面值得关注的发现:在复杂任务上,Claude Code 主动请求澄清的频率超过人类主动干预频率的两倍。Agent 会暂停确认,而不是一路冲到底。这是特性,不是缺陷。

"这项研究的核心启示是:Agent 在实践中行使的自主权,是由模型、用户和产品共同构建的。Claude 在不确定时会暂停提问,以此限制自身的独立性。用户在与模型协作的过程中建立信任,并相应地调整自己的监督策略。"

Levie 的垂直 AI 打法

Aaron Levie 指出了等待被解锁的巨大财富与价值:构建接入专有数据的 Agent 软件,让它真正解决真实的人和问题,把上下文塞满以最大化智能输出,以及——这是大多数创业者忽略的部分——推动客户侧的变更管理。

最后这一点正是垂直 AI 如此难以被复制的原因。任何人都能搭一个 API 封装,但很少有人能真正驾驭医疗账单、法律发现或建筑许可证审批中特有的工作流、监管约束和组织阻力。

SaaS 在过去几十年里每十年增长十倍。过去 20 年超过 40%的风险投资资金流向了 SaaS 公司。这个行业诞生了 170 多只 SaaS 独角兽。逻辑很简单:这些独角兽中的每一只,都有一个垂直 AI 版本在等待出现。而 AI 版本可能会大十倍,因为它取代的不只是软件,还有操作人员。

共同构建的本质

Anthropic 的核心发现值得任何参与 AI 政策制定的人认真关注。自主权不是模型的固有属性,而是由模型、用户和产品共同构建的。部署前的评估无法捕捉这一点,你必须在真实使用中去衡量。

Anthropic 官方表示:

软件工程约占我们 API 上 Agent 工具调用量的 50%,但我们也看到其他行业正在涌现。随着风险与自主权的边界持续扩展,部署后的监控变得至关重要。我们鼓励其他模型开发者扩展这项研究。

安全层面的数字令人放心:73%的工具调用有人类在回路中参与,只有 0.8%的操作是不可逆的。最高风险的部署场景——如 API 密钥泄露或自主加密交易——大多是安全评估,而非真实生产环境。

"规定具体交互模式的监管要求——例如要求人类批准每一个操作——只会制造摩擦,而不一定带来安全收益。"

强制要求"批准每一个操作"的政策,会杀死生产力收益,却不会增加安全性。更好的目标是确保人类能够监控和介入,而不是规定具体的审批工作流。

独角兽藏在哪里

地图已经画好。软件工程已经有人在做了。医疗、法律、金融、教育、客服、物流——16 个垂直领域,每个市场份额均为个位数——都在等待有人把领域专业知识真正嵌入 Agent。

此前诞生了 300 只 SaaS 独角兽,接下来 300 只垂直 AI 独角兽即将出现。那些选定垂直领域、把领域专业知识嵌入 Agent、并想明白如何驱动变更管理的创始人,将拥有下一个十年的企业软件市场。

模型已经能工作五小时,用户只让它工作 42 分钟。这就是信号:我们仍然处于极早期,还有大量东西可以建造,而且在无数个还没有见过哪怕一分钟智能发挥作用的地方。

相关问答

Q根据Anthropic的研究,AI Agent工具调用量主要集中在哪个领域?

A根据Anthropic的研究,AI Agent工具调用量主要集中在软件工程领域,占据了近50%的调用量。

Q文章中提到哪些垂直领域是AI Agent的蓝海市场?

A文章中提到医疗、法律、金融、教育、客服、物流等16个垂直领域是AI Agent的蓝海市场,每个领域的市场份额均低于5%。

QAnthropic的研究发现模型的能力与用户实际使用之间存在什么差距?

AAnthropic的研究发现,模型的能力已经可以解决需要人类近五小时完成的任务,但用户实际使用中,第99.9百分位的会话时长只有约42分钟,这表明用户对AI的信任度仍有较大差距。

Q文章中提到垂直AI独角兽的出现需要哪些关键因素?

A垂直AI独角兽的出现需要构建接入专有数据的Agent软件,具备深度领域专属的上下文工程能力,以及推动客户侧变更管理的能力,同时要解决特定垂直领域的工作流和监管约束。

QAnthropic的研究在安全层面有哪些令人放心的发现?

AAnthropic的研究发现,73%的工具调用有人类在回路中参与,只有0.8%的操作是不可逆的,且最高风险的部署场景大多是安全评估而非真实生产环境,这表明AI Agent在实际使用中具有较高的安全性。

你可能也喜欢

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit3小时前

如何让自己变得让人工智能永远也无法取代

marsbit3小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru6小时前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru6小时前

交易

现货
活动图片