Claude两个新模型实测流出,空间推理封神,算力直接榨干了

marsbit发布于2026-08-25更新于2026-08-25

文章摘要

Anthropic两款代号为“棉花糖”(claude-marshmallow-eap)和“甜瓜”(claude-melon-eap)的新模型实测信息曝光。实测显示,它们在3D强化学习和建筑空间布局任务上表现惊人,能够一次性(One-Shot)生成理解复杂空间关系与物理约束的完美方案,展现了强大的空间推理能力,在游戏开发、建筑设计和数字孪生等领域潜力巨大。 此外,新模型消耗了海量的后台“思考token”进行深度逻辑推理,多次触及系统的token使用上限,表明Anthropic正将竞争焦点转向推理阶段的算力投入,以提升答案质量。 这两款模型在旗舰模型Opus 5发布后不久泄露,引发了它们是Opus 5缺陷修复版(Opus 5.1)或是新一代Sonnet/Haiku模型的猜测。无论身份如何,都显示出Anthropic正在加速模型迭代,以应对市场竞争。

昨天刚刚曝出的Claude 两款新模型——棉花糖和甜瓜,今天已有实测出现了!

有人实测后发现,两款新模型在3D强化学习和建筑空间布局上,性能强到可怕。

另外,它们对算力的吞噬也十分疯狂。

在给出答案前,它们会消耗海量的「思考token」(Thinking Tokens)进行深度逻辑推理,甚至屡次逼近系统的使用上限!

从这款模型看,Claude正在进化为具备「慢思考」、深度空间物理推理能力的下一代 AI 巨兽。

One-Shot 拿下3D强化学习与建筑布局

有人实测后给出评价:Anthropic真的在疯狂推进3D强化学习。

建筑物的空间布局简直好得令人发指,而且这一切都是一步到位(One-Shot)生成的!

要知道,对于LLM,空间想象力一直是个死穴。

让AI理解一个 3D 房间中桌椅的物理坐标关系、重力法则,或者规划一个拥有复杂动线和承重结构的建筑群布局,简直难如登天。

但这次,Claude 的「棉花糖」和「甜瓜」似乎跨越了这道鸿沟。

它们能够直接理解并生成复杂的3D坐标和空间关系。

而且,实测中发现它们的建筑布局极其优秀,表示新模型在处理拓扑学、几何学和物理约束时性能也很强大。

并且,它们是One-Shot输出,不需要人类反复调整prompt去修正错误,模型经过深度的内部思考后,一次性就能输出完美的3D场景数据。

这背后隐藏着巨大的商业和产业价值。

想象一下,未来的游戏开发者只需要用自然语言描述:「帮我生成一个中世纪风格的要塞,包含三个防御塔和一个隐藏的地下通道」,Claude就能直接输出完美的3D模型代码或布局参数。

建筑师可以直接让AI根据地形和光照条件生成几十种符合力学结构的初步布局方案。元宇宙、工业数字孪生、自动驾驶仿真环境的构建......

这一切,都将因为这种强大的 3D 生成能力而被彻底重塑!

棉花糖与甜瓜的双重暴击

昨天,全网都被棉花糖和西瓜刷屏了。

这次曝光的两款模型内部代号分别为 claude-marshmallow-eap(棉花糖)claude-melon-eap(甜瓜)

这种「食物+EAP」的命名规则,延续了他们在今年7月短暂测试过的 claude-horchata-eap(欧恰塔,一种墨西哥饮料)的传统。

这两款模型到底是从哪里冒出来的?

据开发者从 API 流量记录中截获的数据显示,在8月21日的 00:45-00:57Z 期间,claude-marshmallow-ht-eap 的 ID 在 API 流量中被高频调用了 57 次!

随后,它在 Claude Code 的模型列表中以「Custom model」的身份赫然出现,并达到惊人的100万 Token 超长上下文窗口。

虽然目前这两款模型还没有第一方 API 端点,似乎仅限于红队测试人员或内部核心人员使用,但早期的零星测试反馈已经足够炸裂。

「棉花糖」 的综合能力被认为略强于「甜瓜」。

在日常对话和逻辑交互中,「棉花糖」的体验甚至比目前的 Opus 5 还要好,对话显得更加自然、宜人。

尽管它们目前的表现似乎还在 Anthropic 顶级的「Fable」级别之下,但它们到底是传说中的 Opus 5.1?Sonnet 5.1?还是全新的 Haiku 迭代?

现在还没有定论。

算力吞噬者:疯狂的「思考token」

不仅如此,多位测试者都发现了一个极其反常的现象:这两个新模型在使用时,对算力的消耗达到了极其疯狂的地步!

一位测试者在推文中惊呼:「我注意到这两个模型的一个共同点,它们使用了海量的思考token,以至于我在测试时,多次直接触发了 (最大token数)的上限!」

什么是「思考token」?为什么它如此重要?

在过去的大模型交互中,AI 往往像是一个「快言快语」的应答者,根据概率分布,逐字逐句地瞬间生成答案。

而Claude 的新一代模型,彻底改变了这一逻辑。在最终给出答案之前,模型会在后台生成大量的「隐形」Token,用来进行极其深度的自我推演、思维链构建和逻辑试错。

这种「不计成本」的计算力倾注,释放出了一个极其强烈的信号: Anthropic 正在暗中攻克 AI 深度推理的瓶颈!

这也印证了此前行业内的猜测——大模型的竞争正在从「训练阶段的算力堆叠)」向「推理阶段的算力消耗」转移。

当 Claude 开始疯狂「思考」到触碰上限时,它所输出的答案质量,将形成对传统模型的降维打击。

疑似紧急救火?Opus 5 的「复仇之战」

这两款神秘模型的突然泄露,时机也很微妙。

仅仅在不到一个月前的 2026 年 7 月 24 日,Anthropic 刚刚发布了万众瞩目的旗舰模型 Opus 5。

在此之前,6月30日发布的 Sonnet 5 曾广受好评。

然而,Opus 5却惨遭滑铁卢。

有开发者在X上无情嘲笑:「Opus 5 的负面评价实在太严重了,以至于 Anthropic 不得不立刻推出两个新模型来试图取代它......笑死我了。」

确实,Opus 5 似乎没能满足用户对「跨代际提升」的期待。对于急于上市Anthropic 来说,这无疑是一次重大打击。

因此,「棉花糖」和「甜瓜」在这个节骨眼上被曝出,引发了外界的无限遐想。

猜想一:Opus 5.1 的绝地反击。

许多人认为,这两个与 Opus 5.1 紧密关联的模型,正是 Anthropic 针对 Opus 5 缺陷进行紧急回炉重造后的「威力加强版」。

通过引入强大的「思考token」机制,强行拔高模型的逻辑天花板。

猜想二:新一代 Sonnet / Haiku 的突袭。

也有测试者认为,考虑到其惊人的速度和性价比,它们可能是 Sonnet 或 Haiku 的更新版,毕竟它们并未被冠以顶级的「Fable」称号。

但无论是哪种情况,Anthropic 显然已经坐不住了。

他们正在疯狂加快迭代速度,甚至不惜将极度消耗算力的前沿模型直接下放测试。X

开发者们已经按捺不住激动:「接下来的几周到几个月,将会变得极其有趣!」

棉花糖和甜瓜,能否一雪Opus 5的前耻,让Anthropic再赢一局?

参考资料:

https://x.com/Lentils80/status/2091704307863142812?s=20

https://x.com/NFT_Chen/status/2091764673767198730?s=20

本文来自微信公众号“新智元”,作者:ASI启示录;编辑:Aeneas

相关问答

Q文章中提到Claude新模型'棉花糖'和'甜瓜'在哪些特定领域的性能表现尤为突出?

A文章指出,'棉花糖'和'甜瓜'在3D强化学习和建筑空间布局方面表现突出,特别是能够一步到位(One-Shot)生成复杂且符合物理约束的3D场景数据和建筑布局。

Q根据文章,什么是'思考token'?它对Claude新模型的性能有何影响?

A'思考token'是指Claude新一代模型在最终给出答案前,在后台消耗大量Token进行深度自我推演、思维链构建和逻辑试错的过程。这种机制允许模型进行'慢思考'和深度推理,虽然会消耗海量算力,但极大地提升了其逻辑推理和空间物理推理的答案质量。

Q文章对Anthropic突然泄露'棉花糖'和'甜瓜'两款新模型的时机提出了哪两种主要猜想?

A文章提出了两种主要猜想:一是它们可能是针对Opus 5表现不佳而紧急推出的'威力加强版'Opus 5.1;二是它们可能是Sonnet或Haiku系列的新一代更新版本。

Q文章认为Claude新模型强大的3D生成能力,可能在未来对哪些产业或应用场景产生深远影响?

A文章认为,这种强大的3D生成能力可能重塑游戏开发、建筑设计、元宇宙、工业数字孪生以及自动驾驶仿真环境构建等多个产业和应用场景。

Q测试者发现Claude新模型在使用时表现出什么共同的反常现象?

A测试者发现,'棉花糖'和'甜瓜'在使用时会消耗海量的'思考token',以至于多次直接触发了系统设置的(最大token数)使用上限,显示出对算力的疯狂吞噬。

你可能也喜欢

Kinetiq团队宣布用于Hyperliquid的L2网络Elysium

8月24日,流动性质押协议Kinetiq宣布为Hyperliquid生态系统推出新的L2网络Elysium,旨在提升HyperEVM的吞吐能力,并简化现货市场、代币及DeFi应用的启动流程。Elysium将使用$HYPE支付Gas费,并计划直接与HyperCore交易引擎连接,使应用能访问其流动性和订单簿数据。具体技术细节、合作伙伴及上线时间尚未公布。 Elysium的开发源于对HyperEVM现有局限的改进,包括低吞吐量、高负载时费用上升及双区块架构。新网络承诺在启动时显著提升区块生产与交易处理速度,未来目标接近HyperCore的性能,以更好地支持高频现货交易、AMM等需要频繁状态更新的DeFi应用。此外,Elysium还将为开发者提供更深入的订单簿数据和实时报价。 目前,在Hyperliquid生态内启动新资产涉及多个步骤。Elysium拟整合该流程,使代币能通过AMM获得初始流动性,随后进入HyperCore现货订单簿,最终通过HIP-3机制上线永续合约市场。 Kinetiq还公布了Elysium的收入分配模型:50%的序列器费用将用于公开市场回购并销毁$KNTQ,25%分配给使用区块空间的应用程序开发者,剩余25%归入Kinetiq国库。此举标志着项目业务从$HYPE的流动性质押扩展到更广泛的生态。Kinetiq的主要产品kHYPE(质押$HYPE后获得的代币)仍为核心。 截至6月,Hyperliquid的未平仓合约量已增至100亿美元,成为第三大永续合约交易平台。

cryptonews.ru5分钟前

Kinetiq团队宣布用于Hyperliquid的L2网络Elysium

cryptonews.ru5分钟前

交易

现货
活动图片