老黄垒20年的CUDA护城河,AI刚刚用10小时凿开了

marsbit发布于2026-08-04更新于2026-08-04

文章摘要

一家名为Infinity的初创公司使用其AI编程代理Ignition,仅用10小时就为AI推理芯片公司d-Matrix搭建了一套“类CUDA”底层软件,旨在加速针对特定芯片的Kernel生成与优化。这引发了关于英伟达近20年构筑的CUDA软件护城河是否被颠覆的讨论。 文章指出,英伟达的核心优势在于其围绕GPU建立的完整软件生态,而不仅仅是硬件。CUDA作为其生态核心,包含了底层内核、优化计算库及庞大的开发者社区。然而,在AI推理市场,竞争规则有所不同:推理更关注单次回答成本而非极致性能,且软件可以跨芯片运行,这削弱了CUDA的锁定效应,为众多专用推理芯片(如d-Matrix、Rebellions等)提供了切入机会。 尽管AI代理能快速生成代码,但多位行业专家认为,这远未颠覆CUDA生态。挑战在于生产级性能优化、代码验证的复杂性,以及迁移数百万行现有代码的组织成本。此外,英伟达自身也在利用AI加速CUDA开发与验证。因此,短期内英伟达在训练领域的地位依然稳固,但推理侧可能成为变局的开端。长期的竞争关键,或将从代码存量转向验证与优化生态的构建。

CUDA又双叒叕被创了...

这回动手的,还是英伟达亲手喂大的AI。

一家成立仅一年的小公司,用AI编程Agent,只花10小时,就搭出了一套「类CUDA软件」。

停停停。

你是说这套英伟达花了近20年搭起来的软件帝国,就这么被复刻了??

不止如此。 DeepSeek 也在尝试少写一点底层CUDA。

他们已经开源了一套名为TileKernels的GPU算子库,用TileLang来编写,省去了大量手写底层CUDA代码的工作。

不过类似的「CUDA危机」,咱也不是第一次听了。

每隔一段时间,CUDA都要被拎出来鞭打一番,动辄替代了、击穿了、护城河又被颠覆了...

真的是这样么?

10小时「复刻」CUDA

提起英伟达,很多人的第一反应是GPU。

H100、Blackwell、Rubin,靠着一代代性能更强的芯片,英伟达吃下了这一轮AI浪潮的最大红利。

但英伟达真正难以撼动的优势,其实不是硬件,而是软件

芯片可以买,参数可以追,制程也会迭代。真正让客户用了英伟达之后很难再换走的,是围绕GPU建立起来的整套软件生态

CUDA,就是这套软件帝国的核心。

CUDA全称Compute Unified Device Architecture,由英伟达高管Ian Buck带队,花了近20年打造。

它常被叫作编程语言,但更准确地说,CUDA是一整套围绕英伟达GPU建立的软件平台

如果简单拆成三层,最底下是内核层,直接让芯片干活的Kernel、编译器和运行时。

中间是库层——cuBLAS、cuDNN等经过高度优化的计算库,以及调试、验证和性能分析工具。

最上面,则是PyTorch、TensorFlow等开发框架,企业积累的海量代码和工作流,以及围绕CUDA成长起来的开发者生态。

这么说可能有点抽象,但你可以把英伟达GPU想象成一家工厂。

CUDA最底层负责告诉机器每一步怎么干,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。

所以,对客户来说,买到的不只是英伟达的一块卡,而是一座开箱即用的工厂。

现在,一位名叫Jeremy Nixon的老哥,带着AI Agent来了。

Nixon是AI软件初创公司Infinity的创始人,此前也在Google Brain当研究员。

他的团队开发了一套名为Ignition的AI研究Agent,专门给不同AI芯片编写底层软件。

它可以生成GPU Kernel、运行测试、寻找错误、测量性能,再根据结果自动改写代码。

人类工程师负责给出高层方向,剩下那些琐碎又费脑子的工作,就交给Agent反复循环。

就这样,Infinity用Ignition为AI芯片初创公司d-Matrix搭建了一套类CUDA软件。

只花了10小时

啊??

那些过去需要芯片软件工程师反复调试的底层代码,现在真能交给AI了?

还真不能说完全是炒作。

AI Agent确实很适合这种具有明确反馈的编程任务。

代码能不能编译,结果算得对不对,性能有没有提高,都可以通过实际运行得到答案。

于是,Agent能够形成一个完整闭环:

写代码→编译→运行→测试正确性和性能→根据反馈继续修改

不过,Infinity主要攻入的是CUDA的第一层:为不同芯片生成和优化推理Kernel,并围绕这些Kernel搭建底层软件能力。

它正在开发一套面向多种芯片的通用推理库,但这不等于它在10小时内复制了CUDA近20年积累的完整生态。

但是...

但是!

你实际上并不需要复制一个CUDA,就可以拿下1500万美元的融资

这家公司目前的估值也已经来到了1亿美元

有没有威胁到英伟达不知道,反正资本是相当买账的。(doge)

推理侧,第二战场启动!

如果说AI Agent是攻城的武器,那推理市场就是城墙上的缺口。

大模型的计算主要分成两段:

训练是造模型,需要上万块卡协同跑几个月;推理是用训好的模型回答问题,小集群甚至单卡就能跑。

在训练侧,CUDA目前依然近乎无解。

大规模训练对性能、稳定性和集群协同极为敏感。芯片之间的通信、显存的调度、程序出错后如何恢复,任何一点效率损失,放大到数千乃至数万块芯片上,都会变成真实的时间和成本。

因此,企业选择训练平台时往往极其保守。

其他芯片即使纸面参数不错,只要软件不够成熟、集群不够稳定,省下来的硬件成本,很可能从开发和试错成本里加倍偿还。

但在推理侧,游戏规则变了

韩国AI芯片公司Rebellions首席商务官Marshall Choy就认为:

在推理侧,CUDA不再是决定因素。这将是一场开源软件的竞争。

为什么竞争者都盯上了推理?

因为训练在乎「极致性能」,而推理在乎的是「每个回答的成本」。

训练需要上万块卡协同,推理可以拆分到小集群甚至单卡;训练不敢换芯片,但推理可以。

反正只要能跑、便宜,客户就愿意试。

更关键的是,推理软件可以跨芯片运行。如果推理框架能支持多种芯片,用户就能在不同硬件之间切换,不用重写代码——

CUDA最大的锁定效应,就此失效。

这就给专用推理芯片留下了机会。

推理任务并不都需要CUDA从训练到集群协同的全部能力。针对特定模型、特定场景重新设计的芯片,只要能够跑得更快、更便宜或者更省电,就有机会从英伟达手里切下一块市场。

比如d-Matrix,本身就是一家主打推理的芯片公司。

这家公司成立于2019年,主攻生成式AI推理芯片。

联合创始人兼CEO Sid Sheth曾回忆,他们很早便判断,AI推理带来的机会最终会超过训练

Infinity用AI Agent花10小时搭建的类CUDA软件,服务的正是d-Matrix的推理芯片。

于是,「10小时事件」的完整故事就连起来了:

新芯片想进入推理市场,但缺少成熟软件;AI Agent快速生成和优化底层Kernel,把原本可能耗费数月乃至数年的适配工作压缩到小时或天。

Sid还明着放话:

虽然英伟达在训练领域保持主导地位,但在推理方面,护城河有所削弱。

盯上这个缺口的,也不止d-Matrix一家。

主攻推理的Rebellions、d-Matrix,押注晶圆级芯片的Cerebras,亚马逊的Inferentia、谷歌的TPU、AMD的MI300X......

各路芯片厂和云计算巨头,早已在推理市场排兵布阵,准备从英伟达手里抢下一块肉。

对这些公司来说,他们不需要立刻替代英伟达。

他们只需要证明,在某些推理任务中,不依赖英伟达的全套硬件和CUDA生态,也能跑得更快或者更便宜。

这就足够了。

英伟达护城河,到底颠没颠覆

答案可能是...还差得远

前面也说了,10小时重写的是「一块芯片的适配代码」,而CUDA生态还有20年积累的库、调试工具、社区、几百万开发者。

这并不是轻轻松松就能被颠覆的。

更关键的是,代码能生成,不等于能用。

INT21创始人Bing Xu,上一家AI芯片软件公司HippoML被英伟达收购,他本人今年4月才离开英伟达。

他的判断是:Agent能在短时间内生成大量代码,但验证才是最大瓶颈

AI生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。

CUDA最深的资产恰恰是它的验证工具链——所以他认为,Agent时代,验证生态会成为CUDA的下一道护城河

Modular联合创始人兼CEO Chris Lattner,也泼了盆冷水。

他认为编码Agent带来的改进是渐进式的,「炒作被严重夸大」。

理由有三:第一,写代码只是软件工程的一小部分,生产级优化才决定芯片性能,直接决定跑AI的成本;

第二,芯片软件是小众精英领域,公开代码远少于应用开发,AI在这块能学的训练数据本来就少;

第三,几百万行存量代码的迁移成本还在,这不是技术能解决的,属于组织决策。

还有一点容易忽略的是:英伟达自己也在使用AI

英伟达开发者生态副总裁Ankit Patel表示:

我们也在使用AI Agent来更快地开发CUDA,并在更大规模上进行验证。

以己之矛,攻彼之盾,进攻方的相对优势也会打折。

Bing Xu总结下来:这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。

但很显然,这家全球最大的芯片制造商,「并没有在睡觉或原地踏步」。

总的来说,短期内英伟达的护城河安然无恙,但变化会先在推理侧悄悄发生。

长期的真正悬念是:护城河正在从「代码的存量」迁移到「验证和优化的生态」。

谁先占住新位置,谁才是下一个赢家。

参考链接:[1]https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8

本文来自微信公众号“量子位”,作者:听雨

热门币种推荐

相关问答

QInfinity公司的AI Agent是如何在10小时内为d-Matrix创建出类CUDA软件的?

AInfinity公司开发的名为Ignition的AI研究Agent,专门为不同AI芯片编写底层软件。它通过生成GPU Kernel、运行测试、查找错误、测量性能,并根据反馈结果自动改写代码,形成一个完整的编程优化循环(写代码→编译→运行→测试→修改),从而快速生成为d-Matrix推理芯片定制的底层软件。其主要攻入了CUDA最底层的Kernel生成和优化层。

Q文章中提到AI推理市场的“游戏规则”与训练市场有何不同?

A文章指出,在AI训练市场,CUDA是近乎无解的决定性因素,因为它涉及对极致性能、稳定性和大规模集群协同的极高要求。而在AI推理市场,游戏规则变了:推理更在乎“每个回答的成本”,而非“极致性能”。推理任务可以被拆分到小集群甚至单卡上运行,对芯片平台的稳定性和生态依赖度低于训练,使得用户可以更灵活地尝试那些能跑、便宜且更省电的专用推理芯片,因此CUDA的锁定效应在推理侧有所削弱。

Q为什么d-Matrix公司认为在AI推理领域,英伟达的护城河有所削弱?

Ad-Matrix公司认为,AI推理带来的商业机会巨大,且推理任务本身更侧重于成本和效率,而不像训练那样需要CUDA提供完整的、涉及大规模协同和极致稳定性的全套软件生态。推理任务可以更独立、更轻量地运行。因此,只要推理芯片能在特定任务上比英伟达方案跑得更快、更便宜或更省电,就有市场机会。他们相信英伟达在训练领域的主导地位难以撼动,但在推理方面,其护城河已经不如训练侧那么坚固。

Q文章中Bing Xu和Chris Lattner对AI Agent颠覆CUDA生态的观点是什么?他们提出了哪些挑战?

ABing Xu(INT21创始人)认为,AI Agent能快速生成代码,但验证这些代码在各种边界条件下的正确性和稳定性才是最大的瓶颈。CUDA最深的资产是其成熟的验证工具链,而Agent的验证能力仍需极大提升。他认为验证生态将成为CUDA的下一道护城河。Chris Lattner(Modular联合创始人兼CEO)则认为,AI编码Agent的炒作被严重夸大,因为:1) 写代码只是软件工程的一小部分,生产级优化(直接影响AI运行成本)才是关键;2) 芯片软件领域的公开训练数据很少;3) 数百万行存量代码的迁移成本高昂,这属于组织决策问题,不是技术能轻易解决的。

Q根据文章,未来决定这场关于CUDA生态竞争胜负的关键是什么?

A根据文章的观点,这场竞争的长期胜负,取决于竞争对手(如Infinity和其他芯片公司)追赶英伟达软件生态的速度,能否快过英伟达利用AI等新技术自我迭代和进步的速度。同时,护城河的焦点正在从“代码的存量”迁移到“验证和优化的生态”。谁能在新的竞争维度(如自动化验证、跨芯片优化生态)上率先建立起优势,谁才可能成为下一个赢家。文章特别指出,英伟达自身也在积极使用AI Agent来加速开发和验证CUDA,因此竞争者面临的挑战非常巨大。

你可能也喜欢

Changelly研究:稳定币用户不再遵循单一模式

2026年8月4日,即时加密货币交易平台Changelly发布了对2026年上半年平台内稳定币使用情况的研究报告。基于匿名交易数据的分析显示,加密用户正形成差异化的稳定币使用行为模式,而非遵循单一的投资策略。 报告识别出三个具有显著不同交易习惯、交易规模和资产偏好的主要用户群体,表明稳定币在加密生态中扮演着多样化的角色。近半数用户从未使用过稳定币;约45%的用户几乎每笔交易都依赖稳定币;仅有约15%的用户经常在稳定币与其他加密资产间切换。尽管混合资产用户群规模最小,但其平台活跃度最高,交易频率是无稳定币活动用户的6.2倍以上。而以稳定币为主的用户交易频率较低,但平均交易规模达到平台基准的2.5倍。 尽管涉及稳定币的交易笔数占比不到五分之一,但其交易量却贡献了近一半的总交易额,这主要得益于其平均交易规模是非稳定币交易的4.2倍。USDT是绝对主导,占所有交易的近14%和总交易量的40%以上,USDC紧随其后。稳定币已深度融入日常交易,在Changelly十大最受欢迎交易对中占据了31%。 Changelly提供具有竞争力的稳定币兑换服务,包括支持跨链1:1兑换,以帮助用户在不同网络间更高效地转移资产。该研究基于2026年上半年Changelly平台匿名且聚合的交易数据,涵盖了网页和移动端的币币兑换活动。

cointelegraph2分钟前

Changelly研究:稳定币用户不再遵循单一模式

cointelegraph2分钟前

FBI特工盗走百万加密资产,最后被自己的ChatGPT「出卖」

一名41岁的前FBI反情报特工Patrick Steven Yaroch,利用职务之便从其经办的间谍案中盗取了敌方加密钱包内近100万美元的加密货币。他将钱包助记词记在脑中,分10至12次将资产转入个人账户,一年多未被察觉。2026年7月31日,他在弗吉尼亚家中被捕,面临跨州运输赃物和接收赃物两项联邦指控,FBI已追回约92.5万美元。 此案的特殊之处在于,Yaroch并非被调查发现,而是主动向司法部自首。据其交代,盗取资金是因不满政府对相关加密活动未采取行动。调查人员在其手机中发现他曾向ChatGPT咨询如何用100万美元在40岁前退休,并计划移居葡萄牙经营葡萄园。他还预订了前往里斯本的机票,并委托葡萄牙律师处理税务事宜,但声称仅为探友。 资金转移方式并不隐蔽:部分存放在Kraken交易所,另有一部分通过Slush应用转入Sui链上的DeFi协议Suilend——他选择后者部分原因竟是喜欢其水滴形状的logo。这些操作留下了清晰的链上记录。 此案暴露了FBI内部管理漏洞:涉案加密钱包助记词以明文形式存储在系统中,可供特工直接检索并记忆,且长时间未触发安全警报。对公众而言,此案提醒:日常聊天记录可能成为证据;即使是执法机构保管的加密资产凭证,也存在严重的安全风险。

marsbit47分钟前

FBI特工盗走百万加密资产,最后被自己的ChatGPT「出卖」

marsbit47分钟前

交易

现货

热门文章

从H2A到A2A:AI Agent经济体与Crypto新机遇

6月17日,哈佛大学独立研究员、美国AI科学院(NAAI)通讯院士、比特币基金会终身会员韩锋做客火币HTX《大咖讲堂》第三期,以《从H2A到A2A》为主题,分享了其对Agent经济、Crypto基础设施及数字社会未来发展的思考。

559人学过发布于 2026.07.01更新于 2026.07.01

从H2A到A2A:AI Agent经济体与Crypto新机遇

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

2026年,美股IPO市场重回高热度。本文梳理即将上线或受关注的热门赛道龙头,分析具备投资潜力的交易标的及其逻辑,并探讨宏观趋势与相关风险。

2.6k人学过发布于 2026.07.08更新于 2026.07.08

美股TradFi:传统金融在AI IPO浪潮下的稳健锚点

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对AI(AI)币价的意见。

活动图片