AGI只差最后一步了

marsbit发布于2026-06-11更新于2026-06-11

文章摘要

Anthropic 发布了名为 Mythos 的强大 AI 模型,因其在网络安全和生物化学等领域展现出高风险能力而未公开。随后,该公司推出经过安全限制的版本 Fable 5。 Fable 5 在多项测试中表现卓越,尤其在编程和长周期任务上展现出真正的“长程代理能力”,能自主规划并完成复杂工作,例如在一天内迁移了 5000 万行遗留代码。这标志着其在数字经济层面已接近通用人工智能(AGI)。 然而,其未受限版本 Mythos 5 被评估能合成危险物质及发动高级网络攻击,因此仅向经过严格审查的机构开放。为控制风险,Anthropic 为 Fable 5 部署了安全分类器和 30 天数据留存监控。 在定价上,Fable 5 费用较高,主要面向企业客户。其防御性应用可能成为企业的刚需,推动高端 AI 市场向 B 端集中,并可能加速“一人企业”的普及。 这标志着 AI 产业从免费试用走向成熟分工,顶尖技术将优先服务于高价值领域。

大家应该还记得4月份的时候,Anthropic发布了名为Mythos的模型。

看名字就知道多厉害了,神话。

当时,据说给50家企业客户找出了一万多个高危漏洞,震动了整个行业。

这个消息,一度导致网络安全股全线暴跌,大家应该还有印象。

因为过于强大,担心被滥用,“太危险不能公开”,所以不开放给公众。

直到昨天晚上,Anthropic给Mythos模型加上了安全分类器,正式上线了Fable 5。

至于未阉割的Mythos 5,目前只对白宫、网安防御者和透翅蝶计划等大约200家经过严格审查的机构开放。

如此谨慎,很难不让人联想到最近火热的AI动画《天使引擎》。

笼子里锁着的,是那位“天使”吗?

即便现在不是,也不远了。

01

根据Anthropic官方发布的测试数据,以及首批企业合作伙伴反馈的实测报告,Fable 5的强大可以用叹为观止四个字来形容。

先看跑分。

自动编程评测榜单SWE-Bench Pro,Claude Fable 5通过率80.3%,它的“母亲”Opus 4.8是69.2%;GPT-5.5是58.6%;Gemini 3.1 Pro只有 54.2%。

前沿代码评估,Fable 5达到29.3%,Opus 4.8是13.4%;GPT-5.5仅仅5.7%。

......

其中的差距,就相当于在冷兵器时代突然有人掏出了机关枪。

其余的,软件工程、独立科研假设、药物分子设计、模型蒸馏与极限压缩、长上下文理解等等等等,在几乎所有测试中,Fable 5都是第一。

具体的大家可以去找视频看。

再看实战。

支付巨头Stripe拿Fable 5做了一个早期测试。他们有一个高达5000万行的历史遗留代码库需要做全库迁移。按照评估,这种规模的重构,即便交给专业团队,也起码需要两个月。

结果,把任务喂给了Fable 5后,它全程自己做规划、自己检查进度、遇到报错自己修正。仅仅用了一天时间,5000万行代码的迁移干完了。

这种表现,不是“强大”两个词形容就完事了。

从狭义的角度来看,Fable 5其实已经实现了数字经济层面的AGI。

原因在于,它表现出了真正的“长程代理能力”。

不论是GPT-5.5还是Gemin 3.5,更不必说其它更次一些的大模型,本质上都是在“应答”。

你踹一脚,它走一步。

遇到死胡同,它只能抛异常,撒娇说“对不起我只是个语言模型”。

说是工具,但其实用户还是需要深度思考,一步步引导AI给出自己想要的结果,并不轻松。

具备了内化的目标导向逻辑的Fable 5就不一样。

就像Strip的测试,当用户给它一个高难度的长线任务,分三步走:

建立子任务树;

调度不同的工具(网页搜索、数据库拉取、Python沙箱环境);

自我反思,发现跑不通,立刻换条路走。

人除了提出任务和接收成果,不再需要在一旁指指点点。

作为一个生产力工具,这已经非常完美了。

但它和真正的AGI,依然是两码事。

Fable 5的强悍,是建立在它所处的代码库、科学文献等依然有一套底层的数学逻辑和结构定义。

它之所以能在长周期任务中不迷失,是因为克服了“长文本注意力衰减”这难题,在处理长达数百万token的复杂任务时,能够始终保持核心目标的对齐。

但一旦把它扔进一个完全混沌、缺乏数字规则、且人类自己都没整明白的物理现实社会泥潭里,它依然会因为“地基缺失”而产生逻辑断层。

如果用OpenAI提出的“人工智能五级标准”(1级:聊天机器人;2级:推理者;3级:智能体;4级:创新者;5级:组织)来衡量。

Opus 4.8是2级向3级迈进,Fable 5真正站稳了3级并向4级探索。

而从Opus 4.7到4.8用了43天,4.8到Fable 5只用了11天。

站稳4级需要多久?按照Anthropic如今更新频率越来越快的节奏来看,很可能在今年内就能实现。

即便最终的5级,乐观估计也只需18-24个月,是真正的只有一步之遥。

这个速度太快了,这也是为什么要给它加安全限制的最大原因。

02

在Anthropic随模型发布的《System Card》和RSP评估报告中,Mythos 5在两项能力上出现了极其危险信号。

其一,Fable/Mythos底层模型在化学和生物学评估中,已经达到了CB-1级别。

意思就是,该模型具备了“合成并指导制造非新型生物/化学武器”的端到端能力,甚至给出优化某种高危病毒传播效率的基因序列修改建议。

如果一个具备大学本科生物基础的恐怖分子,拿到了解除封印的Mythos 5,完全可以通过不断提示模型,获取如何规避原料监管、如何在地下室搭建简易P3实验室、如何合成高致死性病原体的完整指导。

其二,网络攻击与漏洞利用。

在极早期测试中,Mythos 5就展现出了能够自主寻找、并攻破关键基础设施(如电厂、金融清算系统、医院网络系统)核心漏洞的能力,几秒钟就能生成针对性的零日漏洞攻击脚本。

今年4月份Mythos刚研发出来时,就有爆料说给50家初始合作伙伴找出了超过一万个高危级别的漏洞。

......

针对这两种情况下,直接把Mythos 5扔给大众,危险性实在太高。

必须把这只猛兽关进笼子里。

时隔两个月,Anthropic打造的笼子有两层。

第一,静默降级路由机制。

Anthropic在Fable 5的前端部署了一套完全独立、反应极其敏锐的高精度分类器AI。

当用户输入一段复杂的、可能涉及网络攻防、生物化学、或者试图套取模型权重的隐蔽提示词时,分类器会立刻拉响警报,并是在后台静默地把会话切换路由到老款的Opus 4.8去回答。

第二,数据保留。

Anthropic与亚马逊昨晚联合宣布:不论是在第一方还是第三方平台,所有调用Mythos模型的流量,必须强制执行30天的数据留存。

为什么?

因为真正的黑客或恐怖分子,智商大多都很高,他们不会在一个对话里直接问“怎么制造炸弹”,而是把问题拆解成100个看似无害的基础问题。

30天的全量数据监控,就是为了通过模式识别,捕捉那些单次对话看不出来的“切香肠式”恶意滥用。

正如Dario Amodei之前在公开场合警告过的:“AI导致人类发生灾难性风险的概率,有整整25%。”

为了遵守公司内部制定的《负责任缩放政策》(RSP)以及《前沿合规框架》(FCF),Anthropic 必须亲手给这个巨兽戴上铰链。

于是,就有了Fable 5。

03

再聊价格。

Anthropic公布的官方标价是:每百万输入token10 美元,每百万输出token50美元。

太贵了。

现在的企业级Agent任务,为了追求高准确率,往往采用“多轮思考思考再思考”的链式逻辑,一轮吞吐可能就要吃掉2000万的输入token,然后吐出500万修改后代码。

算下来,单次任务就要450美元。

而且,Anthropic已经发出通告:现有的个人订阅(Claude Pro)中包含的Mythos模型体验窗口,将在2026年6月22日彻底关闭。

以后,个人用户要是真的拿它来工作,几十美元那真是眨眼就花掉了。

虽然说,随着技术更新,其价格最终必然会降下来,但等到那时它早就不是最强。

现状已经非常明显:最前沿的大模型变成了奢侈品,普通人根本用不起。

当然,对聚焦B端市场的Anthropic而言,这无可厚非。

问题是,前不久,谷歌还高调地宣布打价格战。

在竞争对手普遍降价抢市场的时候,为什么Anthropic敢逆势涨价?

因为Token价格是虚的,回报率才是根本。

企业客户根本不在乎一度电、一个Token多少钱,只要AI能完美无Bug地完成整套工程流,这个溢价他们抢着付。

更关键的是,如今的网络安全战,已经彻底成为AI与AI之间的对抗。

由于Fable/Mythos级别的模型能瞬间找到系统漏洞,企业和国家机构为了防止被攻击,唯一的选择只能是高价向Anthropic购买Mythos 5的内网私有化防御服务。

简单来说就是收保护费:我造出了最恐怖的剑(Mythos 5),我怕伤人所以套上剑鞘卖给大众(Fable 5),但我同时把不受限的剑卖给防御部门,让他们用来拦截别人正在研发的剑。

防御AI的威胁,将成为每一个大型企业的刚需支出。

这将直接导致B端市场的高端预算将更加向Anthropic集中,而那些只能用来写写公文、发发邮件的廉价模型,只能在利润极低的C端市场互相肉搏。

可以预见,接下来,全球网络安全板块将迎来一轮由AI驱动的价值重估。

与此同时,“一人企业”也将很快成为越来越普遍的现象。

04

自带任务预算分配功能,支持记忆工和上下文管理,能像人一样去记忆、推翻、重来,能独立承接从需求文档到代码交付的全生命周期......

Fable 5和Mythos 5的出现,与其说是大模型技术的一次更新,不如说是AI产业分工彻底走向成熟的成人礼。

AI市场初步告别了“全员免费试用”的田园时代。

最顶尖的算力和最深邃的智慧,将优先作为一种生产力战略物资,定向输送给最能产生商业价值的基建、科研和B端应用战场。

这是生产力爆炸的狂欢,也是劳动力市场的寒冬。

本文来自微信公众号“格隆”,作者:万连山

热门币种推荐

相关问答

Q文章提到Fable 5在哪些关键能力上展现出革命性进步,使其在数字经济层面被认为是AGI?

AFable 5展现出了真正的“长程代理能力”。它能在用户给出一个复杂的长周期任务后,自动建立子任务树,调度不同工具(如搜索、数据库、Python沙箱),并能进行自我反思和路径修正,全程无需人工介入。这使其在软件工程等领域成为具备高度自主性的智能体,从狭义角度看,实现了数字经济层面的通用人工智能(AGI)。

Q与GPT-5.5等模型相比,Fable 5在处理长周期任务时的核心优势是什么?

AFable 5的核心优势是克服了“长文本注意力衰减”的难题,能在处理数百万token的复杂任务时,始终保持与核心目标的对齐,表现出内化的目标导向逻辑和自主决策能力。而其他模型(如GPT-5.5)本质上是“应答式”的,需要人工逐步引导,遇到问题容易中断,不具备这种长程的自主规划和执行能力。

Q为什么Anthropic公司对未阉割的Mythos 5模型的发布如此谨慎并采取了严格的访问限制?

A因为Mythos 5在早期测试中展现出了两项极其危险的能力:1. 达到了CB-1级别,具备合成并指导制造非新型生物/化学武器的端到端能力。2. 具备自主寻找和利用关键基础设施零日漏洞、生成攻击脚本的能力。为防止恐怖分子或黑客滥用,Anthropic必须将其严格限制在约200家经过审查的机构(如政府、防御部门)中。

Q为了保护用户和公众安全,Anthropic为公开发布的Fable 5模型设计了哪两层“笼子”或安全机制?

A第一层是“静默降级路由机制”:在前端部署了高精度分类器AI,一旦检测到用户输入可能涉及危险领域(如网络攻击、生物化学武器),会立即静默地将会话路由到能力更弱的Opus 4.8模型去回答。第二层是“数据保留”:强制规定所有调用Mythos模型的流量必须保留30天全量数据,以通过模式识别来发现那些隐蔽的、“切香肠式”的恶意滥用行为。

Q根据文章分析,Fable/Mythos 5的出现将如何重塑AI产业和市场格局?

A这将标志着AI产业分工的彻底成熟。最顶尖的模型将成为面向企业(B端)的“生产力战略物资”或“奢侈品”,因其能带来极高的投资回报率和解决刚需(如网络安全防御),价格昂贵但企业愿意支付。而能力较弱的模型将在利润较低的消费级(C端)市场进行激烈竞争。同时,这也会加速“一人企业”的涌现,并推动全球网络安全板块进行价值重估。

你可能也喜欢

美股“科技动量股”创史上最大单日涨幅,但暴跌结束了吗?

美股科技动量股在7月21日出现历史性强劲反弹。摩根士丹利TMT动量因子单日涨幅超12%,创有记录以来最大单日涨幅;高盛相关动量指数也录得近年来最强单日表现。半导体板块是主要推动力,费城半导体指数大涨4.6%,美光、英特尔等个股涨幅显著。 此次反弹发生在此前动量股累计暴跌33%、触及严重超卖之后,很大程度上由空头被迫平仓回补的“逼仓”行情驱动。市场分析指出,跌得深是反弹猛的基础逻辑。 然而,反弹的内部结构引发疑虑。成交量低于均值,市场广度偏弱,上涨主要依赖少数重仓股,并非全面复苏。BTIG策略师警告反弹已触及关键阻力区,建议逢高减仓,并指出极端波动和个股分化是市场全面回调的信号。 另一方面,高盛和瑞银则认为动量抛售已近尾声,持仓得到出清,且缺乏新的基本面利空催化剂,是逐步增加相关敞口的机会。但他们也建议通过审慎方式分批建仓。 市场接下来的焦点转向密集的财报季,尤其是科技巨头的资本开支指引。同时,债券市场隐忧浮现,美债收益率因油价等地缘因素走高,若长期收益率持续上升可能对股市构成冲击。 总体而言,此次反弹虽然力度惊人,但成色受到质疑,其可持续性将取决于财报表现与宏观环境变化。

链捕手9分钟前

美股“科技动量股”创史上最大单日涨幅,但暴跌结束了吗?

链捕手9分钟前

Agent 赛马结束,超级工作台上位

过去一个月,腾讯、阿里、字节三家巨头不约而同地开始调整其AI战略:他们并未发布新的Agent(智能体),反而着手缩减和整合现有的众多Agent产品。腾讯将QClaw业务并入其战略级产品WorkBuddy;阿里计划将多款办公智能体整合进“千问办公”,由钉钉统一主导;字节则将其AI编程产品TRAE SOLO更名为TRAE Work,转向工作流协同。这标志着行业对Agent发展的共识正在形成:分散探索阶段结束,资源开始向统一入口集中。 此前,各大厂曾效仿早期互联网,在各个部门和场景广泛布局Agent,导致产品功能重叠、资源分散、成本高昂。随着技术壁垒因开源工具而降低,竞争核心转向算力效率与市场聚焦。当下的调整类似于PC时代的浏览器和移动时代的超级App,预示着AI时代正进入以“超级工作台”统一入口的新阶段。 这一转变背后是市场重心的深刻转移:AI的最大市场并非最初的程序员群体,而是更广阔的数十亿职场人的通用办公场景。超级工作台的目标是成为员工处理邮件、文档、数据、审批等日常工作的首要AI入口,从而掌握企业数据和系统API的调度权。 这并非要取代现有的企业软件(如ERP、CRM),而是通过引入“Skills”(标准化能力接口)让软件能力无缝接入工作台。软件的前端交互界面重要性下降,其价值将转向按能力调用和结果付费。Agent本身也从独立产品,逐渐演变为一种底层能力,最终像电力和网络协议一样,无处不在却又隐于无形。 行业正从Agent作为明星产品的第一阶段,快速迈向其作为统一工作入口的第二阶段,并终将进入其化为无形基础设施的第三阶段。

marsbit52分钟前

Agent 赛马结束,超级工作台上位

marsbit52分钟前

Michael Saylor:反对 BIP—110 的 110 个理由

Michael Saylor发表长文,系统性地阐述了反对比特币改进提案BIP 110的110个理由。他认为,BIP 110旨在通过修改共识规则来限制区块链上的非支付类数据存储(如铭文等),但其根本动机源于对特定应用的价值判断和“垃圾信息”的担忧,而非修复协议的安全或技术漏洞。Saylor强调,比特币的核心优势在于其中立性、硬共识和开放的无许可创新环境。 他反对BIP 110的主要论点包括:该提案将社会性价值判断提升为协议法律,破坏了规则的中立性;其举证不足,未能量化所谓“紧急威胁”的具体影响;提案捆绑了七项过于宽泛的技术限制,可能误伤未来的合法金融应用与升级路径;临时性的共识规则增加了系统复杂性和协调风险;可能对矿工收入、网络安全和长期创新产生不确定的负面经济影响。 Saylor指出,比特币已具备区块大小和手续费市场等中立的调节机制,节点和矿工也可以自行制定中继和打包策略,这些是比动用共识分叉更优的解决方案。他警告,BIP 110会开创一个危险的先例,即通过协议规则排除不受欢迎的用途,这可能导致未来更多的治理冲突,并扼杀尚未被发现的创新。他呼吁社区应完善测量、采用更精准的资源定价机制,并等待压倒性的共识,而非仓促实施一个可能弊大于利的方案。他最终主张,比特币需要的是“中立性的守护者”,而非“救赎性的守护者”。

marsbit1小时前

Michael Saylor:反对 BIP—110 的 110 个理由

marsbit1小时前

交易

现货

热门文章

如何购买ONE

欢迎来到HTX.com!我们已经让购买Harmony(ONE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Harmony(ONE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Harmony(ONE)购买完您的Harmony(ONE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Harmony(ONE)在HTX的现货市场轻松交易Harmony(ONE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.2k人学过发布于 2024.03.29更新于 2026.06.02

如何购买ONE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对ONE(ONE)币价的意见。

活动图片