DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战

marsbit发布于2026-07-31更新于2026-07-31

文章摘要

7月31日,DeepSeek V4-Flash正式版API上线公测。值得注意的是,其Agent能力在多项基准测试中已逼近甚至超越三个月前的V4-Pro预览版水平。V4-Flash激活参数仅130亿,表明后训练阶段的优化可能比单纯堆参数更具杠杆效应。 官方称,V4-Flash的模型结构与预览版一致,仅重新进行了后训练。这暗示对于特定任务,训练方法和数据质量的重要性可能正超越模型规模。同时,DeepSeek可能在其自研的Agent框架Harness上做了针对性优化。 当前大模型竞争的关键词已转向Agent能力。DeepSeek此举战略意图清晰:以高性价比的轻量模型切入Agent应用市场。V4-Flash正式版原生支持OpenAI力推的Responses API格式并适配Codex,便于生态迁移,旨在建立自身在Agent时代的生态位。 此次更新距离DeepSeek完成创纪录的超500亿元首轮外部融资不到两个月,高估值下其正加速商业化和IPO进程。Flash的进化给行业提出了新命题:当后训练红利被充分挖掘,大模型的竞争逻辑可能将被重新书写。

7 月 31 日午后,凤凰网科技查询 DeepSeek 官网发现, DeepSeek -V4-Flash 正式版 API 上线公测。与以往 “Pro 强、Flash 弱”的分层逻辑不同,这次更新释放了一个值得关注的信号 ——Flash 正式版在多项 Agent 基准测试中的表现,已经逼近甚至超越了三个月前 V4-Pro 预览版的水平。

官方更新日志显示,V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分,NL2Repo 54.2 分,Cybergym 76.7 分,Toolathlon verified 70.3 分。而 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。

需要说明的是,Terminal Bench 2.0 与 2.1 并非同一版本的测试集,直接对比并不完全公平。但一个激活参数仅 130 亿的轻量版,在 Agent 能力上跑出这样的分数,已经在说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。

此外, DeepSeek 也特别说明目前公测仅限API,App和网页端暂无法体验最新能力。 DeepSeek -V4-Pro正式版将尽快发布。

“仅重新进行了后训练”

DeepSeek 官方在更新日志中表示,“ DeepSeek -V4-Flash-0731 的模型结构、尺寸和 DeepSeek -V4-Flash-preview 保持一致,仅重新进行了后训练。”

根据 DeepSeek 官方技术报告,V4-Flash 总参数 2840 亿,激活参数 130 亿;V4-Pro 总参数 1.6 万亿,激活参数 490 亿。两者在模型规模上相差一个数量级。如果 Flash 能通过后训练把 Agent 能力拉到接近 Pro 的水平,那意味着对于特定任务而言,模型规模并非决定性因素 —— 训练方法和数据质量的权重,正在上升。

官方还特别注明,本次公开基准测试中的 Code Agent 任务,使用了 DeepSeek Harness 极简模式作为框架进行测试,max 档位,topp=0.95,temperature=1.0。这个细节暗示, DeepSeek 可能在 Agent 框架层面也做了针对性优化,而非仅仅是模型本身的提升。

这也是 DeepSeek 官方自研Harness首次以正式命名出现,此前,梁文锋曾把AGI的实现路径比作爬楼梯:语言模型是第一级,去年解决的是CoT(思维链),今年的台阶是Agent,而Agent之后必须解决的问题,是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。再往后,才是自我迭代的“奇点”与具身智能 。“

AI现在不缺品位和直觉,它缺的是持续学习的能力”他说,“投资人看Agent,我们看怎么解决学习。”

持续学习听起来是模型层面的命题,但它的工程落点,恰恰在Harness上。 DeepSeek 的Agent Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年,今年3月加入 DeepSeek ,此后其在5月大力招兵买马。

据透露,DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示,“DeepSeek-V4-Pro 正式版将会尽快发布。”

生态层面的一次正面交锋

如果说 2023 年的大模型竞争是 “拼通用能力”,2024 年是 “拼长上下文”,那么 2026 年的关键词,毫无疑问是 Agent。

Agent 能力 —— 即模型自主规划、调用工具、执行复杂任务的能力 —— 正在成为衡量大模型实力的新标尺。从 Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到 Cybergym(网络安全任务)、SWE-bench(软件工程),一系列 Agent 基准测试正在重新定义什么是好模型。

从全球范围看,Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据,GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中,GLM、Qwen 等也在快速追赶。

DeepSeek 此次将 Flash 的 Agent 能力大幅拉升,战略意图很清晰:用高性价比的轻量模型,切入 Agent 应用的庞大市场。

毕竟,Agent 场景对推理速度和成本的敏感度,远高于纯对话场景。一个需要反复调用工具、多轮推理的 Agent 任务,如果用旗舰模型跑,成本可能是 Flash 的数倍甚至数十倍。如果 Flash 能在 Agent 能力上达到 “够用甚至好用”的水平,其性价比优势将极具杀伤力。

官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分 68.7,DSBench-Hard(内部 Coding Agent 难题测试集)得分 59.6。这从侧面印证了 DeepSeek 的定位 —— 把 Flash 打造成开发者和 Agent 应用的首选底座。

一场生态暗战也在悄然打响,正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。

Responses API 是 OpenAI 力推的新一代 API 格式,相比传统的 Chat Completions,它更适合 Agent 场景 —— 支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。

DeepSeek 原生支持这一格式,意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。

对 Codex 的适配,则瞄准了代码生成与软件开发这一垂直场景。Codex 是 OpenAI 面向代码领域的模型, DeepSeek 针对性适配,等于直接在 OpenAI 的传统优势领域发起挑战。

这些动作放在一起看, DeepSeek 的野心不止于做一个“便宜的替代品”,而是要在 Agent 时代建立自己的生态位。

500 亿融资之后:高估值下的时间窗口

此次更新,距离 DeepSeek 完成首轮外部融资不到两个月。

约一个多月前, DeepSeek 完成成立近三年来的首轮外部融资,总额超 500 亿元人民币,创下中国 AI 行业单轮融资纪录,投后估值约 520 亿美元(约合人民币 3500 亿元)。投资方阵容包括腾讯、宁德时代、京东等产业巨头,以及多家国资产业基金。

7 月中旬, DeepSeek 有意推进新一轮私募融资,投前估值约 710 亿美元(折合人民币约 4800 亿元),较首轮融资后的 520 亿美元估值上涨约 37%。从 520 亿到 710 亿,间隔不足六周。

高估值背后,是市场对 DeepSeek 技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。

据多家媒体报道, DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从 “不融资不上市” 转向积极拥抱资本,本身就是一个强烈的信号 —— DeepSeek 正在加速冲向商业化和 IPO。

Flash 正式版的上线,或许可以看作 DeepSeek 在资本加持下的一次 技术兑现。但真正的考验还在后面:Pro 正式版能否如期而至?Agent 能力的提升能否转化为实打实的收入?在 OpenAI、Anthropic 等巨头的夹击下, DeepSeek 的高性价比路线将如何发挥优势。

Agent 战争的大幕才刚刚拉开。 DeepSeek 用一个轻量模型的大幅进化,给行业出了一道新题 —— 当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。

本文来自微信公众号“凤凰网科技”,作者:凤凰网科技

热门币种推荐

相关问答

QDeepSeek V4-Flash正式版在哪些关键Agent基准测试中表现亮眼,分数如何?

A根据文章,DeepSeek V4-Flash正式版在多项Agent基准测试中表现出色,具体分数为:Terminal Bench 2.1拿到82.7分,NL2Repo 54.2分,Cybergym 76.7分,Toolathlon verified 70.3分。官方测试还使用了内部测试集DSBench-FullStack(68.7分)和DSBench-Hard(59.6分)。

QDeepSeek V4-Flash正式版相比V4-Pro预览版,在模型规模和Agent能力上有什么关键差异?

A模型规模上,V4-Flash总参数2840亿,激活参数130亿;V4-Pro总参数1.6万亿,激活参数490亿,两者相差一个数量级。关键差异在于,尽管模型规模小很多,但V4-Flash通过后训练优化,其Agent能力在多项测试中已经逼近甚至超越了三个月前的V4-Pro预览版水平,这表明训练方法和数据质量的重要性正在超越单纯的参数规模。

QDeepSeek V4-Flash正式版的发布在技术和生态层面展现了哪些战略意图?

A技术层面,展示了通过后训练优化而非单纯堆砌参数来高效提升模型(特别是轻量模型)Agent能力的路径。生态层面,其战略意图是:1. 以高性价比的轻量模型切入对成本敏感的Agent应用市场;2. 原生支持OpenAI的Responses API格式,旨在降低开发者从OpenAI生态迁移的成本,进行生态层面的正面交锋;3. 针对性适配Codex,挑战OpenAI在代码生成领域的传统优势,目标是建立自己在Agent时代的生态位,而非仅仅是廉价替代品。

Q文章中提到的“Harness”是什么?它在DeepSeek的技术规划中扮演什么角色?

A根据文章,Harness是DeepSeek自研的Agent框架(全称为DeepSeek Harness),在这次更新中首次以正式命名出现。它不仅仅是模型评测工具,更是实现Agent能力、特别是未来“持续学习”能力的关键工程落点。DeepSeek创始人梁文锋将AGI的实现比作爬楼梯,认为Agent之后必须解决“持续学习”问题,而Harness正是解决这一问题的核心。DeepSeek为此组建了专门的团队,并计划在V4正式版上线时同步推出其Harness。

QDeepSeek近期的融资情况如何?这对公司的发展意味着什么?

ADeepSeek近期完成了两轮重要融资:1. 约一个多月前完成首轮外部融资,总额超500亿元人民币,投后估值约520亿美元,创下中国AI行业纪录。2. 7月中旬有意推进新一轮私募融资,投前估值约710亿美元,较首轮上涨约37%。高估值意味着市场对其技术和商业化前景的认可与押注,但也带来了高预期和压力。创始人梁文锋在首轮融资中出资约200亿并保持控制权,公司从“不融资不上市”转向积极拥抱资本,表明其正在资本加持下加速冲向商业化和IPO。V4-Flash的发布可视为一次技术兑现。

你可能也喜欢

比特币八月行情:专家预计将测试价格区间,而非快速反转

比特币在八月可能继续承压,分析师预计市场将测试关键区间而非快速反转。七月比特币从多年低点反弹,但专家认为持续上涨条件尚不成熟,价格仍有跌至6万美元以下的风险。截至七月底,比特币交易于约6.35万美元,较2025年10月的历史高点下跌约50%。市场目前处于6万至6.5万美元的窄幅区间内。 分析师指出,高利率、持续通胀、强势美元以及石油价格等因素共同构成不利的宏观经济背景,压制了比特币价格。此外,美国国债等传统资产的高收益率吸引了部分资金,而加密货币ETF资金持续流出(上半年净流出54亿美元),显示机构需求疲软。 从历史数据看,八月通常是加密货币的弱势月份。专家认为市场可能正处于新周期开始前的最后阶段,建议投资者可考虑逐步积累仓位,但需警惕短期波动。 主要预测场景如下: - 基本情况(50%概率):在5.8万至6.8万美元区间震荡。 - 负面场景(30%概率):跌破5.8万美元,下探5万至5.5万美元。 - 正面场景(20%概率):突破6.7万美元,目标看向7.1万至7.5万美元。 关键支撑位在6万至6.1万美元附近,而稳定在6.7万美元上方可能打破下跌趋势。部分分析师认为,即便反弹至7万美元,也可能出现新一轮下跌,长期目标位指向约5.3万美元区域。多数观点认为,更显著的趋势性行情可能需等到今年第四季度。 投资者在八月需密切关注利率、通胀数据、ETF资金流、市场风险偏好以及主要参与者的动向,这个月可能更多是对耐心的考验,而非实现重大突破的时机。

cryptonews.ru1小时前

比特币八月行情:专家预计将测试价格区间,而非快速反转

cryptonews.ru1小时前

Coldcard硬件钱包被黑:黑客在25分钟内转走594枚比特币

硬件钱包Coldcard遭黑客攻击:25分钟内损失594枚比特币 硬件钱包长期以来被认为是存储数字货币最安全的方式,但Coinkite公司设备近期发生的事件迫使许多人重新审视这一观点。2026年7月30日,攻击者在短短25分钟内从500个地址转走了594.5枚比特币(约合4000万美元)。 问题的根源在于一个潜伏了五年的软件代码错误。Coldcard本应通过安全芯片生成真随机数来创建种子短语,但由于一个宏定义中的笔误,Coinkite的开发者早在2021年3月就意外禁用了此功能。这导致设备转而基于可预测的数据(如处理器序列号和内部系统时钟)生成密钥,使得生成的种子短语看似安全,实则因生成过程可预测而极易被破解。对于Mk2和Mk3型号,密钥搜索空间骤降至约40位,而更新的Mk4、Mk5和Q型号的最终熵值也仅为约72位,远低于所需的128位。 攻击者无需物理接触设备或进行网络钓鱼。他们仅利用了有缺陷的生成器参数,在离线状态下进行大规模枚举,生成了数百万可能的种子短语,并通过公开账本找到有余额的地址,自行签署了转账交易。 Coinkite最初声称新版本设备不受影响,但后续分析迫使公司承认所有运行受影响固件的设备均存在风险。公司负责人Rodolphe Novak已公开道歉,但排除了对受损用户进行经济补偿的可能性。 对于已创建种子短语的用户,仅更新固件无法消除风险。必须将设备更新至安全版本固件,在更新后的设备上生成全新的种子短语,并将所有资金完全转移到由此新种子短语生成的新地址。使用BIP-39标准的密码短语可降低风险,但不能替代密钥迁移。公司的其他产品如TAPSIGNER等未受此次事件影响。 此事件表明,即使是专用硬件也需要对代码进行持续独立的审计,尤其是在加密功能方面。从机器分析角度看,这与过去OpenSSL等随机数生成器缺陷长期未被发现的情况类似。开源代码理论上可通过独立审计和自动化工具加速发现此类错误,但此次漏洞潜伏五年表明理论与实践仍有差距。

cryptonews.ru1小时前

Coldcard硬件钱包被黑:黑客在25分钟内转走594枚比特币

cryptonews.ru1小时前

交易

现货

热门文章

如何购买T

欢迎来到HTX.com!我们已经让购买Threshold Network Token(T)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Threshold Network Token(T)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Threshold Network Token(T)购买完您的Threshold Network Token(T)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Threshold Network Token(T)在HTX的现货市场轻松交易Threshold Network Token(T)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

2.0k人学过发布于 2024.07.04更新于 2026.06.02

如何购买T

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对T(T)币价的意见。

活动图片