AMD收购Taalas:硬件AI绕开紧缺的HBM内存

cryptonews.ruPublished on 2026-08-09Last updated on 2026-08-09

Abstract

AMD同意收购多伦多初创公司Taalas,该公司旨在解决神经网络推理中的核心问题:传统上每个令牌生成都需要将模型权重从内存传输到处理器,导致速度受限并推高了对高带宽内存(HBM)的需求。Taalas的芯片将模型权重直接“固化”在晶体管中,无需重复数据移动。 Taalas由Ljubisa Bajic和Lejla Bajic于2023年创立,已获2.19亿美元融资。其首款测试芯片基于台积电6纳米工艺,为Meta的Llama 3.1 8B模型提供服务,声称生成速度比当时对比的Nvidia显卡快48倍。其架构分为两部分:模型权重被硬编码为掩膜ROM;另一部分为可变的SRAM,用于缓存和微调适配器。 但这种硬件固化存在明显折衷:每个芯片永久服务于单一模型,更换模型需部分重新设计拓扑,即使采用缩短的周期也需要约两个月。这使得该方案仅适用于稳定、广泛使用且值得“冻结”的高价值模型。因此,此次收购并未改变AMD与Nvidia在推理市场竞争的格局,后者更注重生态系统和软件层面的竞争。 收购的核心启示在于内存市场。当前行业普遍认为HBM等内存将长期短缺,价格高涨,但Taalas的技术证明内存瓶颈是工程挑战而非物理定律,可以被规避。同时,Nvidia通过模型压缩和量化减少内存占用,三星、SK海力士等内存制造商也在开发如zHBM、高速闪存等新技术以降低对HBM的依赖。 这表明,当前基于内存永久短缺的定价假设,正面临来自多方面的工程创新挑战。内存历来是周期性行业,今日的高价可能正在助推未来使其过剩的技术发展。从历史看,类似比特币ASIC的极端硬件专业化虽能提升速度,却以失去灵活性为代价,其成功取决于底层算法(或AI模型架构)是否足够稳定。

AMD公司已同意收购多伦多初创公司Taalas,该公司旨在解决神经网络推理的一个主要问题——为生成每个标记(token)而需要不断将模型权重从内存加载到处理器中。Taalas的芯片无需执行此操作:模型权重直接“焊入”晶体管。正是这种数据的反复搬运限制了现代推理的速度,并使高带宽内存(HBM)成为半导体行业最紧缺的商品。

这笔交易将被视为AMD与Nvidia在推理领域竞争的新一轮交锋,但在该领域它改变不了多少格局。更有趣的是,这次收购揭示了内存市场的现状——这是目前半导体领域最热门的交易焦点。

Taalas创造了什么

Taalas由卢比沙·巴伊奇(Ljubisa Bajic)和他的妻子莱拉·巴伊奇(Lejla Bajic)于2023年创立。卢比沙此前创立了芯片公司Tenstorrent,而莱拉曾是ATI和AMD工程部门的资深人士,担任运营总监一职。该公司从富达投资、Quiet Capital和半导体投资者皮埃尔·拉蒙德那里筹集了2.19亿美元——资金用于开发所谓的“模型专用集成电路”。

首个采用台积电6纳米工艺制造的测试芯片,能够以每秒16,960个标记的速度处理Meta的Llama 3.1 8B模型。该公司宣称,在测试时,这比Nvidia显卡快48倍,比Cerebras加速器快8.5倍。面向200亿参数模型的第二代芯片预计将于今年推出。

其架构分为两个区域:一个区域将模型权重作为掩膜ROM内存“烧录”其中,另一个则是普通的SRAM,用于缓存和仍然可以改变的微调适配器。“正是这种‘硬编码’在某种程度上赋予了我们的速度,”巴伊奇在今年二月接受《The Next Platform》采访时解释道。

AMD计划将Taalas芯片以拆分方式集成到其Helios服务器机架中:Instinct加速器将处理提示(prompt),而Taalas硅片负责生成标记,所有操作都在ROCm软件栈的管理下进行。AMD强调,这是一次收购而非仅仅是团队招聘,交易预计在第四季度完成。AMD负责AI的高级副总裁万西·博帕纳将此次收购描述为平台扩展。

Taalas做出的妥协

将权重“焊入”硅片有明显的代价:每颗芯片永久性地只为一种模型服务。更换模型需要部分重新设计芯片拓扑,即使采用Taalas的缩短周期方案——即仅更换晶圆上近乎完成的两个金属层——在台积电的生产线上也需要大约两个月时间。顶级模型的更新速度更快。这种方案只在模型稳定、广泛使用且足够有价值可以“冻结”时,才可能收回成本。

同样的妥协也解释了为何这笔交易不会改变推理市场的力量平衡。Nvidia在12月以200亿美元收购了Groq——这是其史上最大的收购——旨在将专门用于生成标记的硬件集成到那个已经构建起整个行业的平台中。推理之争是生态系统和既有软件层面的竞争,而绑定单一模型的芯片与这两者都无关。Taalas方法真正证明的是一个更具体但更有趣的论点:限制推理的内存瓶颈是一个工程解决方案,而非物理定律,它是可以被规避的。

内存问题

当前市场定价假设这种内存短缺是永久性的。第一季度普通DRAM的价格上涨了近90%。高带宽内存(HBM)实际上在2026年之前都已售罄,预计今年HBM市场规模将达到546亿美元。控制着超过一半HBM供应的SK海力士,市值已突破1万亿美元,并宣布投资381亿美元建设新工厂。对于普通投资者而言,对整个内存领域的押注都基于一个假设:AI需求将使内存在未来数年持续短缺。

这个假设正同时受到多方面的挑战。Taalas完全消除了模型权重在服务过程中对内存的需求,而Nvidia的工程师们则通过压缩和量化模型来减少已部署模型占用的内存量。

内存制造商自身也在朝同一方向努力。三星在FMS大会上展示的zHBM技术将内存直接堆叠在加速器上,有效倍增了带宽。SK海力士和Sandisk刚刚发布了首个旨在用低成本NAND闪存取代当前HBM工作的高速闪存标准。几乎每个行业主要参与者都在资助其降低对该稀缺资源需求的方法,而市场目前认为该资源会永久短缺。

AMD买到了一个证据,证明推理可以在不依赖那个决定当前整个AI需求周期的紧缺组件的情况下运行——并且将在内部仍装有GPU和HBM的机架中销售这个证据。那些认为当今内存价格是AI基础设施建设周期永恒特征的投资者,正在与一个规模庞大且不断增长、目标恰恰相反的工程运动对赌。

内存一直是周期性行业。那些按当前价格支付的人,刚刚资助了又一个证明它将继续如此的原因。

AI观点

从机器学习数据分析角度看,Taalas芯片的关键先例不在AI领域,而在加密货币行业。用于比特币挖矿的专用集成电路(ASIC)解决了类似的问题——为了速度将算法“焊入”硅片——并产生了相同的副作用:完全不灵活。哈希电讯此前曾描述,硬件专业化达到极致时,当基础算法变更或新的计算范式出现,会带来过时的风险。

文章未详细阐述的技术层面涉及闲置期的经济性:当一颗Taalas芯片服务于单一模型时,竞争实验室每几个月就会发布新版本,而更换拓扑的重新编程周期在台积电的生产线上需要大约两个月时间。ASIC的历史表明,专业化只有在算法稳定时才具有经济性——问题在于,大型语言模型的架构是否会足够稳定,值得进行这样的赌注。

Trending Cryptos

Related Questions

QAMD 收购的初创公司 Taalas 解决了神经网络推理中的哪个关键问题?

ATaalas 解决了神经网络推理中需要为生成每个token而频繁将模型权重从内存传输到处理器的瓶颈问题。其芯片通过将模型权重直接固化在晶体管中,消除了这一数据传输需求,从而大幅提升速度,并减少了对昂贵且紧缺的高带宽内存(HBM)的依赖。

QTaalas 芯片的架构有什么独特之处?

ATaalas 芯片的架构分为两个区域:一部分是模型权重被硬编码在掩膜ROM存储器中(即固化在硅片中),另一部分是用于缓存和仍可调整的适配器的常规SRAM。这种将权重“焊死”在硬件上的设计是其实现高速推理的关键。

QAMD 计划如何整合 Taalas 的技术到其产品线中?

AAMD 计划将 Taalas 的芯片集成到其 Helios 机架中,采用分工方案:其 Instinct 加速器将负责处理提示,而 Taalas 的硅片则专门负责生成 token。整个系统将在 AMD 的 ROCm 软件栈下进行管理。

QTaalas 的“将权重焊入硅片”方法的主要妥协或代价是什么?

A这种方法的主要代价是芯片一旦制造出来,就只能永久性地服务于一个特定的模型。更换模型需要部分重新设计芯片拓扑结构(即使采用精简流程,如只更换两个金属层),这通常需要约两个月的时间在台积电的生产线上完成。因此,该方案只有在模型本身非常稳定、被广泛使用且价值足够高,值得被“冻结”的情况下才具有经济可行性。

Q文章认为当前AI基础设施周期中对HBM内存极度依赖的现状可能如何被改变?

A文章指出,当前市场假设HBM的短缺是永久性的,但这一假设正受到多方挑战。除了Taalas彻底消除权重内存访问外,NVIDIA等公司通过模型压缩和量化来减少内存占用;同时,内存制造商如三星(推出zHBM技术)、SK海力士等也在开发新技术(如高速闪存标准),旨在用成本更低或集成度更高的方案来替代或减少对HBM的需求。这意味着当前的HBM紧缺状况可能是一个工程问题,而非物理定律,市场正通过广泛的技术创新来应对它。

Related Reads

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

In just three days after Bitcoin's price recovery, new Bitcoin whales have realized over $1.2 billion in profit, marking the largest profit-taking event for this cohort on record according to CryptoQuant. The peak occurred on August 20 with roughly $614 million, setting a daily record. Analysts note this selling pressure began after Bitcoin rose above the realized price of short-term whales, which was around $68,900. With Bitcoin trading near $77,700 on August 23, these whales were sitting on an average profit of about 12.8%. The market recovery allowed investors who were previously at breakeven or at a loss to lock in gains. CryptoQuant described the situation as a key test for Bitcoin demand; sustained prices above whale cost-basis with normalized profit-taking could signal strong new demand, while continued selling pressure could turn the rally into a mere break-even exit. Simultaneously, large Ethereum holders have also returned to an unrealized profit zone following its rally, as noted by CryptoQuant analyst Darkfost. Current profit levels, however, remain relatively low and are not seen as creating significant selling pressure. The Unrealized Profit/Loss Ratio for different whale cohorts stands at 0.075 (for 1k-10k ETH holders), 0.16 (10k-100k ETH), and 0.38 (over 100k ETH). This marks a significant improvement from June, when these whales were in substantial unrealized loss, with Ethereum having risen over 65% since then. The increased profitability is viewed as a positive sentiment signal for the Ethereum market.

cryptonews.ru8m ago

Demand Test: Bitcoin Whales Earn Record $1.2 Billion, Ethereum Holders Return to Profitability

cryptonews.ru8m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

On August 24, the liquid staking protocol Kinetiq announced Elysium, a new L2 network for the Hyperliquid ecosystem. It aims to increase HyperEVM's throughput and simplify the launch of spot markets, tokens, and DeFi applications. Elysium will use $HYPE for gas fees and plans direct integration with HyperCore's trading engine, giving apps access to its liquidity and orderbook data. Technical details and partners will be revealed later, with a launch date set for "soon." A primary reason for Elysium's development is to overcome HyperEVM's limitations, such as low throughput and rising fees during high load. Kinetiq claims the L2 will start with significantly higher block production and transaction speeds, later aiming to approach HyperCore's performance. This targets applications needing frequent state updates like high-frequency spot trading and AMMs, and will provide them deeper access to HyperCore orderbook data. The network also proposes to streamline the process of launching new assets within Hyperliquid, allowing a token to progress from AMM liquidity to HyperCore's spot orderbook and eventually to perp markets via HIP-3 in a unified flow. Regarding revenue, Kinetiq's model allocates 50% of sequencer fees to buy back and burn $KNTQ, 25% to developers using Elysium's block space, and 25% to the Kinetiq treasury. Elysium marks Kinetiq's expansion beyond its core liquid staking product, kHYPE.

cryptonews.ru9m ago

Kinetiq Team Announces Elysium L2 Network for Hyperliquid

cryptonews.ru9m ago

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of AI (AI) are presented below.

活动图片