AMD公司同意收购多伦多的初创公司Taalas,该公司解决了神经网络推理的一个主要问题——在生成每个令牌时,都需要将模型权重从内存持续调入处理器。Taalas的芯片无需此操作:模型权重被直接“焊入”晶体管之中。正是这种数据传输限制了现代推理的速度,并使高带宽内存成为半导体行业最紧缺的商品。
这笔交易将被视为AMD与Nvidia在推理领域竞争的又一回合,但在这方面改变不大。更有趣的是,此次收购揭示了内存市场的状况——这是半导体行业目前最热门的交易领域。
Taalas创造了什么
Taalas由Ljubisa Bajic(此前创立了芯片公司Tenstorrent)及其妻子Lejla Bajic(ATI和AMD工程部门的资深人士,担任运营总监)于2023年创立。公司从Fidelity、Quiet Capital和半导体投资者Pierre Lamond那里筹集了2.19亿美元,资金用于开发所谓的“针对特定模型的集成电路”。
首个采用台积电6纳米工艺制造的测试芯片,以每秒16,960个令牌的速度服务Meta的Llama 3.1 8B模型。据公司宣称,在比较时,这比Nvidia显卡快48倍,比Cerebras加速器快8.5倍。面向200亿参数模型的第二代芯片预计将于今年推出。
其架构分为两个区域:一个区域将模型权重作为掩膜ROM存储器硬编码,另一个是普通的SRAM,用于缓存和仍可更改的微调适配器。“正是这种硬编码在某种程度上赋予了我们速度,”Bajic在二月份向The Next Platform解释道。
AMD计划以分离式架构将Taalas芯片集成到Helios机架中:Instinct加速器处理提示,而Taalas硅片生成令牌,全部在ROCm软件栈的管理下进行。公司强调,这是收购而非仅仅招聘团队,交易预计在第四季度完成。AMD人工智能高级副总裁Vamsi Boppana将此次收购描述为平台的扩展。
Taalas所做的妥协
将权重焊入硅片有明显的代价:每个芯片永久性地服务一个特定模型。更换模型需要部分重新设计拓扑结构,即使采用Taalas缩短的周期(在几乎完成的晶圆上仅更换两个金属层),这在台积电的产能下也需要大约两个月时间。顶级模型的更新速度更快。这种策略只有在模型稳定、被广泛使用且具有足够价值以锁定其版本时才能获得回报。
同样的妥协也解释了为何这笔交易不会改变推理市场的格局。Nvidia在12月以200亿美元收购了Groq(其历史上最大收购),旨在将专门用于生成令牌的硬件集成到那个已建立起整个行业的平台中。推理领域的竞争发生在生态系统和既有软件层面,而绑定单一模型的芯片则无法参与其中。Taalas的方法真正证明的是一个更具体但更有趣的观点:限制推理的内存瓶颈是一个工程问题,而非物理必然,并且是可以绕过的。
内存问题
市场目前的价格已隐含了一个假设:这种内存短缺将持续存在。第一季度普通DRAM的价格上涨了近90%。高带宽内存实际上已售罄至2026年全年,预计今年HBM市场规模将达到546亿美元。控制着超过一半HBM供应的SK hynix,市值已突破1万亿美元,并宣布了381亿美元的建厂计划。对于普通投资者而言,对内存的全部押注都基于一个假设:AI需求将使内存短缺持续数年。
这个假设正受到多方面的挑战。Taalas完全消除了服务模型过程中对权重内存的需求,而Nvidia的工程师压缩和量化模型也正是为了减少已部署模型所需的内存量。
内存制造商自身也在朝同一方向努力。三星在上一周FMS会议上展示的zHBM技术,将内存直接堆叠在加速器上,成倍提高了有效带宽。SK hynix和Sandisk刚刚发布了首个高速闪存标准,旨在用廉价的NAND替代当前由HBM执行的工作。实际上,该行业的每个主要参与者都在投资于各种方法,以减少对那个市场认为将永久短缺的资源的需求。
AMD买到了一个证明——证明推理可以在不依赖那个定义当前整个AI需求周期的紧缺组件的情况下运行——并将把这个证明销售给那些内部仍然装有GPU和HBM的机架。那些认为当前内存价格是AI基础设施建设周期永久特征的投资者,正站在一个大规模且不断增长的工程运动对立面,该运动的目标恰恰相反。
内存一直是周期性业务。那些为其支付当前价格的人,刚刚为这一现状将保持不变又资助了一个理由。
AI观点
从机器数据分析的角度来看,Taalas芯片的关键先例并非来自AI世界,而是加密货币行业。比特币挖矿专用集成电路解决了类似的问题——为了速度将算法焊入硅片——并产生了同样的副作用:完全缺乏灵活性。Hash Telegraph曾描述过,硬件专业化推到极致,会在基础算法变更或新的计算范式出现时,产生过时淘汰的风险。
文章未详细展开的技术方面涉及闲置经济性:当Taalas芯片服务一个模型时,竞争实验室每隔几个月就发布新版本,而在台积电产能下,重新设计拓扑的周期需要大约两个月。ASIC的历史表明,专业化只有在算法稳定的情况下才有回报——问题在于,大型语言模型的架构是否足够稳定,值得进行这样的押注。






