黑鲸出水,DeepSeek下半场开始

marsbit发布于2026-08-13更新于2026-08-13

文章摘要

8月13日,DeepSeek发布了两项重要更新:一是DeepSeek V4 Pro正式版发布,二是其自研的AI智能体执行系统“DeepSeek Harness”开发者预览版以MIT协议开源。 文章指出,在AI Agent时代,决定智能体实际效能和成本的不只是模型本身,外部的“执行系统”同样关键。测试表明,同一DeepSeek V4-Flash模型接入不同的执行系统,完成任务的数量和成本可能相差数倍。Harness正是为了最大化释放模型潜力、控制任务执行成本而打造。 DeepSeek Harness的核心设计哲学是“一切皆插件”,其基于Cordis插件系统构建,允许开发者通过插件灵活替换或扩展模型、工具、UI等几乎所有组件,而非固定形态的AI助手。它强调可追溯性,采用只追加的会话日志,确保执行过程可审查、可恢复。其团队负责人具有量化交易系统背景,注重系统在复杂任务下的稳定执行与风险控制。 Harness的发布标志着DeepSeek商业模式的潜在转变:从按消耗的Token收费,转向为任务完成的结果负责。这使其与Claude Code等产品形成差异化竞争。尽管Harness目前仅为v0.1预览版,面临生态建设、市场接受度等挑战,但它代表了DeepSeek将前沿能力低成本化、并接入可落地系统的一贯战略方向。其未来很大程度上取决于开源社区的参与和共建。

DeepSeek最具潜力项目登场,一切皆可插件。Harness不是要模仿谁,而是要把定义的权限交给开源社区。

8月13日傍晚, DeepSeek 官方终于发声,两个重要信息发布。其一,是 DeepSeek V4 Pro正式版发布,并同步在 APP、网页端和 API 更新上线。用户可以通过 APP 或网页端选择“专家模式”使用全新的 V4 Pro 正式版模型,API 模型名不变。

其二,有着一只黑色鲸鱼头像的“ DeepSeek Harness团队”迎来首次发文,宣布Harness开发者预览版正式上线,并以MIT协议开放源代码。

如此前预告,V4 Pro正式版与官方自研Harness同步亮相,由于我们此前已经着重介绍过V4 Pro,本篇文章将重点为大家解析, DeepSeek Harness为什么有看点。

以及经过今天, DeepSeek 会不会从一家模型公司,变成一家更难定义的公司。

01

同一个模型,换套外壳像换了个人

要理解Harness为什么重要,得先理解一个反直觉的事实:在Agent时代,决定一个AI能不能干活的,不只是模型。

8月6日和11日,智能体工具公司Composio通过两次测试实验,试图证明Harness的价值。研究者把同一个 DeepSeek V4-Flash接入八种不同的Harness,也就是套在模型外面的执行系统,让它们分别完成三十项多步骤任务。这些任务不是问答,而是要求Agent进入Gmail、Google Calendar、GitHub、Slack等真实应用,调用工具并改变应用状态,每项最长运行十五分钟,全部检查通过才算成功。

结果差距不小。完成最多的Pi Agent通过了二十项,最少的OpenCode只通过十四项;八种Harness总共运行二百四十次,仅一百二十九次成功;三十项任务中,只有六项被所有Harness完成。在成本方面,同样完成十六项任务的Claude Code、Codex和DeepAgents,每完成一项成功任务的估算成本分别约为0.195美元、0.081美元和0.045美元。同一个模型,差了四倍多。

这意味着,模型划定能力的上限,Harness决定这份上限最终能兑现多少、要花多少钱兑现。一项长任务跑下来,执行系统要不停地做判断,上下文里留什么、丢什么,什么时候调哪个工具,工具报错了是重试还是换路,模型说做完了到底信不信、要不要再验一遍。任何一步处理不好,模型就算思路对,也可能在真正改文件、提交代码时功亏一篑。

值得一提的是,这是 DeepSeek 走红以来,极少数提前开放内测的项目。

多个开发者在发布前就拿到了Harness内测资格,有人内测发现,让同一个V4-Flash分别在 DeepSeek Harness、Reasonix和Codex中完成同一款游戏,会跑出截然不同的结果。这说明,当模型完全相同,执行系统提供的工具、提示词、上下文组织和执行策略,足以显著改变最终产物。

这恰恰是 DeepSeek 重视自研Harness的原因。 DeepSeek 内部曾认为,Agent要解决持续学习问题,最终让AI加快AI研发。顺着这条线看,Harness就不是一个外挂的编程工具,而是模型进入真实研发任务的工作台。

除此之外,一家靠低价和模型能力立足的公司,如果任务交付、失败反馈和开发者入口长期挂在别人的系统里,即便其在价格上再有优势,却决定不了一个任务究竟烧掉多少Token、要重试几次、什么时候才算真正完成。

02

一切皆插件,DeepSeek不做谁的替代品

Harness到底是什么?市面上最省事的说法是“ DeepSeek 版Claude Code”。但用完内测版的人普遍认为,这个定位不准确。

据 DeepSeek 官方文档,Harness的核心设计哲学是“Everything is a plugin”——一切皆插件。它基于Cordis插件系统构建,模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有Agent能力均由插件组合而成。开发者不需要改动Harness源码,就能在配置中选择、替换或扩展任意一项能力。

这和通常理解的插件不是一个量级。VS Code的插件是给编辑器加功能,Codex的插件是给Agent加工具;而Harness的插件可以换掉Agent的大脑、工具箱、规则乃至整张脸。

据多位参与内测的人士透露,内测期间开发者在做插件这件事上玩疯了,“大伙都不好好内测了,跑去写插件了”,在短短几天内就出现了几百个插件——有人直接改了整个工作界面,有人用纯插件实现了“跨会话长期记忆加后台自我进化”,让模型定期回头审视自己的工作记录,把临时经验压缩成长久知识。

还有人评价称,开源社区治理可能也是 DeepSeek 接下来要面临的难题。

另一处关键设计是可追溯性。Harness采用只追加(append-only)的会话日志,模型看到的一切——系统提示词、思维链、工具调用与结果、子Agent调度、每一次上下文注入都会被完整记录。上下文压缩不会删除原始历史,只是用替换事件改变模型此后看到的表象。开发者可以在Trajectory视图中按来源追溯,支持恢复、分叉、检索和回放。官方文档把这一原则概括为“模型可见,即已记录”。

这背后是一种典型的系统工程思维。据报道, DeepSeek Harness团队负责人崔添翼本科毕业于浙江大学计算机系,曾在量化交易机构Jane Street任职九年,2026年3月加入 DeepSeek ,5月Harness内部立项。高频量化交易系统的核心壁垒从来不是策略多聪明,而是极端复杂环境下的稳定执行、异常兜底、全程日志追溯和风险可控——这恰好是AI Agent从演示走向生产最缺的那块拼图。有内测开发者用“稳如老狗”形容它跑长任务时的表现:任务断了自动存档,下次接着跑,不用从头再来。

值得注意的是,Harness没有把自己关在 DeepSeek 模型的围墙里。它默认支持接入 Kimi 、OpenAI、Anthropic、Google等近四十家大模型。可能别家倾向于做一个现成的Agent,但 DeepSeek Harness更像一套组件,开发者可以自己决定Agent应该是什么样子,怎么工作。

当然,官方保持了清醒。公告表示,作为早期预览版本,“当前仍有许多细节有待改进和打磨,核心插件与基础接口也将在后续快速迭代”。事实上,这次内测的媒体之一爱范儿就感叹,很难想象,以快著称的 DeepSeek 有一天运行一项编程任务的时间也会来到半个多小时。v0.1的版本号也说明,这条黑鲸刚出水,远没到畅游的时候。

03

从卖Token到交结果,黑鲸的野心

Harness的浮出水面,暗合着整个AI行业的一次转向。

过去数年,大模型公司的竞争集中在参数规模和基准跑分上。但进入2026年,头部模型的基础能力快速收敛,单次问答的差距不断缩小,价格战却愈演愈烈。单纯卖Token的商业模式,天花板已经肉眼可见。行业逐渐意识到,AI产业的核心价值不在模型输出,而在场景落地——同样的Token消耗,闲聊问答价值微薄,而修复一个Bug、完成一次功能开发,可以创造数倍的商业价值。

DeepSeek 的新发布,意味着其从卖算力走向交结果。在旧模式下,客户按Token调用量付费,不管模型有没有真正解决问题;在新模式下,付费的锚点从消耗了多少算力转向完成了什么任务。

这次 DeepSeek Harness发布,广受开发者好评还在于另一重原因。 DeepSeek 不定义Agent本身,而是利用开源社区的扩散能力,去推崇一种Harness方案。这是一条更宏大,也更难的路径。

并且,Harness面对的是Claude Code和Codex已经验证过的成熟市场,后两者背靠Anthropic和OpenAI的模型迭代与商业资源,先发优势明显。开源之后,插件生态能否自发繁荣、开发者是否愿意把生产环境托付给一个0.1版本、国内市场的付费习惯能否支撑“按结果付费”的新逻辑,都是悬而未决的问题。 DeepSeek 自己也表示,核心插件和API仍将快速演进,这意味着早期接入者要承担接口变动的成本。

8月13日这一天,太平洋两岸各有一场发布。马斯克为Grok 4.6站台,称其“智能、快速且性价比极高” ; DeepSeek 什么都没说,只是一味丢更新。

喧嚣与沉默之间,是两种商业哲学的分野。

我们想要称其为 DeepSeek “史上最具潜力项目”,不是因为它今天已经最强。V4 Pro与sota模型仍有差距,Harness还只是v0.1的开发者预览版,涨价后的市场反应有待观察,生态建设更是长路漫漫。潜力之所以是潜力,恰恰因为它尚未兑现。

但如果把时间线拉长,从R1到V4,从模型到Harness, DeepSeek 走的每一步都踩在同一个方向上:把前沿能力压到可负担的成本,再把可负担的能力接入可落地的系统。

黑鲸已经出水。至于它能游多远,在属于开源社区的未来里。

本文来自微信公众号“凤凰网科技”,作者:Dale,编辑:董雨晴

热门币种推荐

相关问答

QDeepSeek Harness 是什么?它的核心设计理念是什么?

ADeepSeek Harness 是 DeepSeek 官方发布的智能体执行系统,是一个基于 Cordis 插件系统构建的工作台,可以让模型在真实研发任务中更好地工作。其核心设计理念是“一切皆插件”,即模型、工具、技能、会话、UI等所有Agent能力均由插件组合而成,开发者无需修改源码即可灵活配置和扩展。

Q根据文章中的实验,Harness 为什么重要?

A实验表明,同一个 DeepSeek V4-Flash 模型接入不同的 Harness(执行系统)后,完成复杂任务的成功率、效率和成本差异巨大。这说明,Harness 虽然不决定模型能力的上限,但决定了模型能力最终能在多大程度上、以多少成本被有效兑现。一个好的 Harness 能够通过优化提示词、上下文管理、工具调用和错误处理等执行策略,显著提升AI的实际工作效果。这表明了执行系统在Agent时代的重要性。

QDeepSeek Harness 相比于 Claude Code 或 Codex 有什么不同?

ADeepSeek Harness 并非仅仅是“DeepSeek版Claude Code”。其主要不同点在于:1. 更加彻底的插件化架构:不只是工具,而是包括模型、UI在内的所有组件都可替换为插件。2. 开放的模型支持:默认支持接入 Kimi、OpenAI、Anthropic、Google 等近四十家大模型,不局限于 DeepSeek 自身的模型。3. 强大的可追溯性:采用只追加的会话日志,确保执行过程的每一步都可追溯、恢复和回放。总的来说,它更像是一套供开发者自定义Agent的基础组件,而非一个封闭、固定的成品Agent。

Q文章提到DeepSeek Harness的负责人崔添翼的背景有何特点?这对Harness的设计有何影响?

AHarness 团队负责人崔添翼本科毕业于浙江大学计算机系,并曾在量化交易机构 Jane Street 任职九年。高频量化交易系统强调极端复杂环境下的稳定执行、异常兜底、全程日志追溯和风险可控。这种背景使 Harness 的设计带有浓厚的系统工程思维,追求长任务执行的稳定性(如“稳如老狗”、任务中断可续跑)和全流程的可追溯性,而这正是当前AI Agent从演示走向实际生产环境所急需的关键能力。

QDeepSeek 发布 Harness 意味着公司怎样的战略转变或野心?

A发布 Harness 意味着 DeepSeek 正在从一家单纯“卖Token”(按模型调用量收费)的模型公司,向“交付结果”(按完成的任务价值收费)的解决方案提供商转变。这表明其战略重心开始从模型能力的竞争,延伸到如何让模型能力更高效、稳定地在实际场景中落地。同时,通过将Harness以MIT协议开源并赋能社区,DeepSeek 旨在构建一个开放的生态系统,将定义Agent形态和能力的权限交给开发者和开源社区,这是一种更具野心和更长远的发展路径。

你可能也喜欢

代币化美债之后,代币化股票正在成为 RWA 新战场

代币化美债市场增长放缓之际,代币化股票正成为RWA(真实世界资产)领域的新热点。其市场规模在一年半内增长约6.5倍,达到约19亿美元,吸引了包括Securitize、Ondo、xStocks、Robinhood、传统金融基础设施商(如DTCC、纽交所、纳斯达克)以及Coinbase等各类玩家的积极布局。 美国SEC将代币化证券主要分为四类:由股票发行人主导的“发行人主导型”;第三方将托管权益代币化的“托管型”;第三方发行挂钩股票价格的独立债务证券的“挂钩证券型”;以及基于衍生品合约的“证券型互换”。不同结构在股东权利继承、链上使用灵活性和合规要求上各有优劣。 主要玩家策略各异:Securitize采用“发行人主导”模式,代币完全继承股东权利但链上使用受限;Ondo和xStocks采用“挂钩证券”模式,通过离岸SPV发行债务证券支持代币,链上可用性高但流动性分散且美国用户受限;Robinhood新推的Stock Tokens也属此类,依托其用户基础寻求增长;DTCC、纽交所等传统基础设施商则在进行代币化结算与交易试点,旨在提升效率;Coinbase已表态将推出代币化股票,具体结构尚未明确,但其“链上可用且排除美国客户”的思路可能接近第三方模式。 各方尽管路径不同,但目标一致:推动资产的代币化,以实现更高效、可及和整合的金融服务。未来监管框架的明确和市场接受度将决定竞争格局,代币化股票有望成为继代币化美债后驱动RWA赛道发展的关键力量。韩国等市场的发展也值得关注。

marsbit47分钟前

代币化美债之后,代币化股票正在成为 RWA 新战场

marsbit47分钟前

英伟达被集体减持,私募们嗅到了什么?

多家知名私募机构在二季度对美国科技股持仓进行了显著调整,核心动向是集体减持AI芯片龙头英伟达,同时加仓半导体制造、存储等产业链环节。 具体来看,高毅资产大幅减持英伟达超70%,景林资产清仓,东方港湾也有所减持。机构分析认为,这并非看空AI趋势,而是投资逻辑从“预期驱动”转向“兑现驱动”。市场更关注企业能否将产业景气转化为实际盈利与现金流。英伟达股价已大幅上涨,估值包含较多乐观预期,赔率下降,资金转而寻找风险收益比更优的标的。 调整方向集中于两个领域: 1. **半导体制造**:高毅资产大举加仓台积电,使其成为第一大重仓股。机构看重其在AI芯片先进制程和先进封装(CoWoS)领域的绝对主导地位与产能瓶颈,这使其成为AI产业链中盈利能见度最高的环节之一。 2. **存储芯片**:高毅资产与东方港湾均增持了美光、闪迪等存储公司。逻辑在于AI催生的高带宽内存(HBM)需求旺盛,挤压了标准存储产能,带动全行业涨价。存储行业正从纯周期属性转向“周期+成长”,当前处于周期底部,具备估值修复与盈利提升的戴维斯双击潜力。 总体而言,私募机构的调仓反映了对AI产业链利润再分配的判断:利润正从芯片设计端,向存在供给刚性瓶颈的制造端(如台积电)和存储端迁移。投资焦点从追逐技术可能性,转向关注谁能掌握实际产能和物理约束。

marsbit1小时前

英伟达被集体减持,私募们嗅到了什么?

marsbit1小时前

【钛晨报】央行出手!万亿买断式逆回购今日落地;DeepSeek官宣涨价、长鑫科技成中国市值最大上市公司;宇树科技遭弃购8734股、史上最大IPO或将易主

央行于8月14日开展1万亿元6个月期买断式逆回购操作,实现等量续作。结合8月5日3个月期逆回购加量2000亿元,央行通过“总量适度、结构精准”的组合操作,旨在维持流动性充裕,配合财政发力并稳定市场预期。 长鑫科技A股市值达3.54万亿元,超越腾讯控股,成为中国市值最大的上市公司。宇树科技公告网上投资者放弃认购8734股。 DeepSeek宣布调整API价格,自8月17日起实施峰谷定价,高峰时段价格较空闲时段高一倍。 联想集团第一财季营收同比增长43.1%,AI相关收入占比达35%。中芯国际第二季销售收入30亿美元,预计第三季收入环比增长2%-4%。京东第二季度Non-GAAP净利润同比增长20.3%。 市场方面,人工智能公司Anthropic被投资方预计将于10月上市,估值可能达2万亿美元,或创史上最大IPO纪录。三星和SK海力士正积极在半导体制造中引入AI系统,并将部署成效与员工绩效考核挂钩。 政策层面,商务部决定对原产于印度的进口单模光纤继续征收反倾销税。广东省自9月1日起提高最低工资标准,广州、深圳调整为每月2680元和2700元。北京专设“老字号发展处”并出台18条举措促进老字号发展。 股市上,德龙汇能澄清无半导体资产注入计划,秦安股份公告主营业务不涉及人形机器人制造,均提示股价偏离基本面的风险。

marsbit1小时前

【钛晨报】央行出手!万亿买断式逆回购今日落地;DeepSeek官宣涨价、长鑫科技成中国市值最大上市公司;宇树科技遭弃购8734股、史上最大IPO或将易主

marsbit1小时前

一夜之间,GPT-5.6 Sol被OpenAI加速了14倍

8月14日,OpenAI联合AI芯片厂商Cerebras正式预览了其旗舰模型GPT-5.6 Sol的新服务层级“超高速模式”。在该模式下,GPT-5.6 Sol的输出速度最高可达750 tokens/s,相比标准模式提速最高达14倍,且不降低质量。横向对比,其速度比Claude Fable 5快11倍,比Opus 4.8快5倍。 在“人类最后的考试”基准测试中,GPT-5.6 Sol超快模式仅用11小时11分钟就完成了全部2500道难题,而Claude Fable 5需要超过78小时。该模式在GDP-Val等基准上也实现了显著的端到端速度提升。 此次突破主要依赖于Cerebras的晶圆级硬件架构。其最新的WSE-3芯片集成了4万亿晶体管和44 GB片上SRAM,使模型参数能常驻在超高带宽的片上内存中,避免了传统GPU因内存带宽限制而产生的数据搬运延迟。对于参数量超过单芯片容量的模型,Cerebras采用了多晶圆流水线并行机制。 更快的推理速度为实时应用开辟了新可能,例如事件响应、金融分析、客户支持、商务推荐和实时研究等。OpenAI内部已在事件响应和研究迭代等场景中测试该模式,显著缩短了从发现问题到制定方案的延迟。 超高速模式将率先在OpenAI API中推出,目前已有部分客户获得有限预览。此举意味着许多原本需切换至次级模型的任务,现在可直接使用旗舰模型快速完成,有望改变AI使用方式。

marsbit1小时前

一夜之间,GPT-5.6 Sol被OpenAI加速了14倍

marsbit1小时前

交易

现货

热门文章

如何购买S

欢迎来到HTX.com!我们已经让购买Sonic(S)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Sonic(S)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Sonic(S)购买完您的Sonic(S)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Sonic(S)在HTX的现货市场轻松交易Sonic(S)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

3.5k人学过发布于 2025.01.15更新于 2026.08.06

如何购买S

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对S(S)币价的意见。

活动图片