梁文锋突袭马斯克,DeepSeek V4 Pro对战Grok 4.6,首测夯爆了
今天,DeepSeek V4 Pro正式版与马斯克的Grok 4.6几乎同时发布,在多个性能评测中直接挑战OpenAI和Anthropic的顶尖模型。
DeepSeek V4 Pro在网络安全智能体测试(CyberGym,83.3分)和自动化任务测试(AutomationBench,31.8分)中均反超Fable 5,取得第一。其软件工程智能体能力更是大幅提升至原版的近4.9倍。Grok 4.6则在多项编码和知识工作评测中表现强劲,在GDPval-AA v2、AA-Briefcase和专业法律任务Harvey LAB三项评测中均拿下第一,综合能力追平GPT-5.6。
价格方面,两大模型极具竞争力。Grok 4.6每百万输出Token成本为6美元,而DeepSeek V4 Pro更是低至0.87美元,仅为其他顶级模型的几十分之一。
首批实测将两款模型投入真实任务对比。在从零搭建3D交互地球、开发部署网站、复刻60种设计风格以及生成3D打砖块游戏等任务中,两者表现接近,互有胜负。例如,在Flappy Bird游戏生成任务中,DeepSeek V4 Pro的成品完成度和细节更胜一筹,且成本更低;而在部分设计任务中,Grok 4.6的视觉效果更佳。不过,在更复杂的图形渲染任务(如生成Three.js樱花树)中,DeepSeek V4 Pro与GPT-5.6 Sol和Claude Opus 5相比仍有差距。
业界评价认为,DeepSeek V4 Pro和Grok 4.6首次将“强大”与“实惠”结合,以极低的成本提供了顶尖的智能体能力,正在打破旧有市场格局。随着Grok 4.7等后续模型的预告,AI领域的竞争将更加激烈。
marsbit08/12 23:51