梁文锋突袭马斯克,DeepSeek V4 Pro对战Grok 4.6,首测夯爆了

marsbit发布于2026-08-12更新于2026-08-12

文章摘要

今天,DeepSeek V4 Pro正式版与马斯克的Grok 4.6几乎同时发布,在多个性能评测中直接挑战OpenAI和Anthropic的顶尖模型。 DeepSeek V4 Pro在网络安全智能体测试(CyberGym,83.3分)和自动化任务测试(AutomationBench,31.8分)中均反超Fable 5,取得第一。其软件工程智能体能力更是大幅提升至原版的近4.9倍。Grok 4.6则在多项编码和知识工作评测中表现强劲,在GDPval-AA v2、AA-Briefcase和专业法律任务Harvey LAB三项评测中均拿下第一,综合能力追平GPT-5.6。 价格方面,两大模型极具竞争力。Grok 4.6每百万输出Token成本为6美元,而DeepSeek V4 Pro更是低至0.87美元,仅为其他顶级模型的几十分之一。 首批实测将两款模型投入真实任务对比。在从零搭建3D交互地球、开发部署网站、复刻60种设计风格以及生成3D打砖块游戏等任务中,两者表现接近,互有胜负。例如,在Flappy Bird游戏生成任务中,DeepSeek V4 Pro的成品完成度和细节更胜一筹,且成本更低;而在部分设计任务中,Grok 4.6的视觉效果更佳。不过,在更复杂的图形渲染任务(如生成Three.js樱花树)中,DeepSeek V4 Pro与GPT-5.6 Sol和Claude Opus 5相比仍有差距。 业界评价认为,DeepSeek V4 Pro和Grok 4.6首次将“强大”与“实惠”结合,以极低的成本提供了顶尖的智能体能力,正在打破旧有市场格局。随着Grok 4.7等后续模型的预告,AI领域的竞争将更加激烈。

今天,这一架太魔幻了!

一边是梁文锋,终于在凌晨放出了 DeepSeek V4 Pro正式版

另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。

两大巨头,同一时间发布,火药味儿瞬间拉满。

他们盯上的,几乎是同一件事——

让模型能在长任务里持续调用工具、修改代码、验证结果,最后交付一个真正能用的成品。

DeepSeek V4 Pro来了

马斯克Grok 4.6出战

DeepSeek V4 Pro正式版最亮眼的成绩,是在两项评测中拿下绝对第一,直接反杀Fable 5。

网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1分、Opus 4.8的78.3分。

自动化任务AutomationBench拿到31.8分,把Fable 5的29.1分和Opus 4.8的27.2分一起压了下去。

最「贴脸」的一次,则发生在Terminal-Bench 2.1

DeepSeek 拿到87.9分,超过Opus 4.8的85.0分,距离Fable 5的88.0分,只差0.1。

其他几项高难度Agent测试中, DeepSeek 则实现了对Opus 4.8的绝对跨越。

带工具的「人类最后考试」中拿到60.0分,反超Opus 4.8的57.9分,继续逼近Fable 5的63.0分。

就连此前最薄弱的软件工程智能体,DeepSWE也从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。

这个成绩不仅超过Opus 4.8的58.0分,距离Fable 5的70.0分也只剩7.3分。

同一时间,马斯克也把Fable 5和GPT-5.6 Sol架在了火上烤。

Grok 4.6先是在综合能力上追平GPT-5.6,再在编码测试中连续完成反超。

综合智能指数上拿到61分,距离Fable 5的62分只差1分。

CursorBench上拿到69.9%,超过GPT-5.6的67.2%,距离Fable 5的70.5%只有0.6个百分点。

FrontierCode上拿到61.3%,也压过GPT-5.6的60.6%,继续紧追Fable 5的63.6%。

到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。

GDPval-AA v2中拿到1753 Elo,超过Fable 5的1741,也超过GPT-5.6的1728。

AA-Briefcase上再拿1577 Elo,压过Fable 5的1574和GPT-5.6的1502。

专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

更狠的是, DeepSeek V4 Pro和Grok 4.6不仅在性能上直逼OpenAI和Anthropic的顶尖模型,还一起把前沿智能的价格打了下来。

每百万输出Token,Grok 4.6要6美元,GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元。

而 DeepSeek 只要0.87美元——

约为Grok 4.6的1/7、GPT-5.6 Sol的1/35、Claude Opus 5的1/29、Fable 5的1/57!

全网首测

DeepSeek大战Grok

现在,第一批实测已经出炉。 DeepSeek V4 Pro和Grok 4.6,也终于从跑分榜走进真实任务场。

第一轮,我们直接给 DeepSeek 上强度。

只用一条提示词,它便在浏览器中从零搭出了一颗完整的3D交互式地球。

拖动、旋转、缩放等基础交互全部可用;全球数据流、动态航线和地理标记,也被完整铺在地球表面。

再往细节看,大气层散射、云层渲染、昼夜光影乃至整套UI界面,同样一应俱全。

接下来,直接把两款模型拉进同一个擂台。

AI博主「向阳乔木」先用 DeepSeek V4 Pro连跑三个小任务,随后又把其中两道题的相同提示词交给Grok 4.6,直接对比最终成品。

第一个任务,是调用3个Skill开发并部署一个网站。

DeepSeek 顺利跑通了整套流程,从页面设计和完成度来看,整体表现非常稳定。

第二个任务,是一次复刻60种设计风格,并生成一整套Bento卡片集中展示。

这一轮, DeepSeek 在字体、配色和版式上做出了明显区分,整体视觉效果相当不错。

最后一个任务,则是从零生成一款3D打砖块游戏。

游戏不仅可以直接上手,还加入了立体场景、背景音乐和动态音效,操作反馈和可玩性全部在线。

随后,相同的提示词被交给了Grok 4.6。

在3D打砖块这一局中,两款模型几乎打成平手。

Grok生成的游戏同样质感在线,无论视觉效果、场景完整度还是可玩性,都与 DeepSeek V4 Pro不相上下。

到了60种Bento设计这一局,Grok 4.6则扳回一分。

它生成的部分页面,在排版、配色和视觉层次上更为成熟,最终效果也更加好看。

更激烈的对决,发生在Flappy Bird上。

开发者Jun Song给出完全相同的提示词,让 DeepSeek V4 Pro和Grok 4.6分别从零「手搓」一款游戏。

结果,两款模型走出了截然不同的路线。

DeepSeek V4 Pro消耗超过2万Token,成本仅为0.019美元;Grok 4.6只使用约5000 Token,成本却达到0.03美元。

但从最终成品来看,这一局 DeepSeek 明显更胜一筹。

游戏中不仅有山脉远景和层叠云朵,水管也带有渐变与体积感。角色穿过水管时,画面甚至会弹出「+1」的浮动动画。

从场景层次到操作反馈,细节几乎全部拉满,端到端构建的完成度明显高于Grok 4.6。

在开发者Hamza进行的另一项前端测试中, DeepSeek V4 Pro再次拿下Grok 4.6。

无论页面完成度还是最终视觉效果,V4 Pro交出的成品都更胜一筹。

不过,V4 Pro也没有场场封神。

在一组鹈鹕对比测试中,相较于Flash版本,V4 Pro的整体画面完成度更高,大象的造型也更加美观。

唯一的问题是——鹈鹕的运动方向,被完全画反了。

继续增加难度,让 DeepSeek V4 Pro、GPT-5.6 Sol和Claude Opus 5使用Three.js生成同一棵樱花树,差距就更加明显。

无论是树干与枝叶的细节,还是光影、景深和整体氛围,V4 Pro都不如另外两款顶尖模型。

DeepSeek V4 Pro;GPT-5.6 Sol;Claude Opus 5

几轮实测看下来, DeepSeek V4 Pro和Grok 4.6确实已经打到了同一水平线,难分伯仲。

两大AI同一天

追上了OpenAI和Anthropic

对于这两款模型的同时爆发,大佬Rick De Oliveira给出的评价是,「强大,而且实惠。」

这 DeepSeek V4 Pro和Grok 4.6的加持下,这两个几乎不可能同时出现的词,在今天,第一次真正走到了一起。

从网络安全、知识型任务到Agent自主解决问题,它们已经在多个战场上,凭借着更低的成本直接击碎了前沿能力的天花板。

回看今天这场魔幻的AI「对轰」, DeepSeek 与Grok共同改写了一条游戏规则:

顶尖智能,不再高不可攀。

过去,开发者往往只能在「用不起」和「不够强」之间艰难选择。

而今天, DeepSeek 用仅为SOTA几十分之一的价格掀翻桌子,Grok则以极高的性价比紧随其后。

这场「高能低价」的正面冲击,已经撕开了旧秩序的裂口。

而战争还没有结束。

马斯克已经提前预告,Grok 4.7马上就来,目标直指超越所有顶尖AI;OpenAI与Anthropic的反击,也必将接踵而至。

身处这个以「小时」为单位进化的时代,智能不再是少数巨头的特权,属于所有人的应用大爆发,才刚刚开始。

参考资料:

https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

https://x.ai/news/grok-4-6

https://x.com/vista8/status/2087577905081823559

https://x.com/vista8/status/2087566666477744620

https://x.com/jun_song/status/2087602149979254914

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西 桃子

热门币种推荐

相关问答

QDeepSeek V4 Pro 在哪些评测中表现突出?

ADeepSeek V4 Pro 在 CyberGym 网络安全智能体测试中拿到 83.3 分,在 AutomationBench 自动化任务中拿到 31.8 分,在 Terminal-Bench 2.1 中拿到 87.9 分,在软件工程智能体测试 DeepSWE 中从预览版的 12.8 分暴涨到 62.7 分。

QGrok 4.6 在哪些评测中超过了 Fable 5 和 GPT-5.6?

A在知识工作的评测中,Grok 4.6 在 GDPval-AA v2、AA-Briefcase 和 Harvey LAB 法律任务三项评测中全部拿下第一,分数超过了 Fable 5 和 GPT-5.6。

QDeepSeek V4 Pro 的价格优势有多大?

ADeepSeek V4 Pro 每百万输出 Token 仅需 0.87 美元,约为 Grok 4.6 的 1/7、GPT-5.6 Sol 的 1/35、Claude Opus 5 的 1/29、Fable 5 的 1/57,价格优势非常显著。

Q文章中提到,在实测任务中,哪款模型在 3D 打砖块游戏和 Flappy Bird 游戏开发中表现更好?

A在 3D 打砖块游戏任务中,DeepSeek V4 Pro 和 Grok 4.6 几乎打成平手。而在 Flappy Bird 游戏的对比中,DeepSeek V4 Pro 的成品在场景层次、细节和完成度上明显更胜一筹。

Q文章对 DeepSeek V4 Pro 和 Grok 4.6 同时发布给出了怎样的评价?

A文章评价这两款模型的同时爆发是「强大,而且实惠」。它们以更低的成本在多个战场(如网络安全、知识型任务、Agent自主解决问题)上击碎了前沿能力的天花板,标志着顶尖智能不再高不可攀,开启了「高能低价」的新时代。

你可能也喜欢

交易

现货

热门文章

如何购买ONE

欢迎来到HTX.com!我们已经让购买Harmony(ONE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Harmony(ONE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Harmony(ONE)购买完您的Harmony(ONE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Harmony(ONE)在HTX的现货市场轻松交易Harmony(ONE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.4k人学过发布于 2024.03.29更新于 2026.06.02

如何购买ONE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对ONE(ONE)币价的意见。

活动图片