AMD公司已同意收购多伦多初创公司Taalas,该公司旨在解决神经网络推理的一个主要问题——为生成每个标记(token)而需要不断将模型权重从内存加载到处理器中。Taalas的芯片无需执行此操作:模型权重直接“焊入”晶体管。正是这种数据的反复搬运限制了现代推理的速度,并使高带宽内存(HBM)成为半导体行业最紧缺的商品。
这笔交易将被视为AMD与Nvidia在推理领域竞争的新一轮交锋,但在该领域它改变不了多少格局。更有趣的是,这次收购揭示了内存市场的现状——这是目前半导体领域最热门的交易焦点。
Taalas创造了什么
Taalas由卢比沙·巴伊奇(Ljubisa Bajic)和他的妻子莱拉·巴伊奇(Lejla Bajic)于2023年创立。卢比沙此前创立了芯片公司Tenstorrent,而莱拉曾是ATI和AMD工程部门的资深人士,担任运营总监一职。该公司从富达投资、Quiet Capital和半导体投资者皮埃尔·拉蒙德那里筹集了2.19亿美元——资金用于开发所谓的“模型专用集成电路”。
首个采用台积电6纳米工艺制造的测试芯片,能够以每秒16,960个标记的速度处理Meta的Llama 3.1 8B模型。该公司宣称,在测试时,这比Nvidia显卡快48倍,比Cerebras加速器快8.5倍。面向200亿参数模型的第二代芯片预计将于今年推出。
其架构分为两个区域:一个区域将模型权重作为掩膜ROM内存“烧录”其中,另一个则是普通的SRAM,用于缓存和仍然可以改变的微调适配器。“正是这种‘硬编码’在某种程度上赋予了我们的速度,”巴伊奇在今年二月接受《The Next Platform》采访时解释道。
AMD计划将Taalas芯片以拆分方式集成到其Helios服务器机架中:Instinct加速器将处理提示(prompt),而Taalas硅片负责生成标记,所有操作都在ROCm软件栈的管理下进行。AMD强调,这是一次收购而非仅仅是团队招聘,交易预计在第四季度完成。AMD负责AI的高级副总裁万西·博帕纳将此次收购描述为平台扩展。
Taalas做出的妥协
将权重“焊入”硅片有明显的代价:每颗芯片永久性地只为一种模型服务。更换模型需要部分重新设计芯片拓扑,即使采用Taalas的缩短周期方案——即仅更换晶圆上近乎完成的两个金属层——在台积电的生产线上也需要大约两个月时间。顶级模型的更新速度更快。这种方案只在模型稳定、广泛使用且足够有价值可以“冻结”时,才可能收回成本。
同样的妥协也解释了为何这笔交易不会改变推理市场的力量平衡。Nvidia在12月以200亿美元收购了Groq——这是其史上最大的收购——旨在将专门用于生成标记的硬件集成到那个已经构建起整个行业的平台中。推理之争是生态系统和既有软件层面的竞争,而绑定单一模型的芯片与这两者都无关。Taalas方法真正证明的是一个更具体但更有趣的论点:限制推理的内存瓶颈是一个工程解决方案,而非物理定律,它是可以被规避的。
内存问题
当前市场定价假设这种内存短缺是永久性的。第一季度普通DRAM的价格上涨了近90%。高带宽内存(HBM)实际上在2026年之前都已售罄,预计今年HBM市场规模将达到546亿美元。控制着超过一半HBM供应的SK海力士,市值已突破1万亿美元,并宣布投资381亿美元建设新工厂。对于普通投资者而言,对整个内存领域的押注都基于一个假设:AI需求将使内存在未来数年持续短缺。
这个假设正同时受到多方面的挑战。Taalas完全消除了模型权重在服务过程中对内存的需求,而Nvidia的工程师们则通过压缩和量化模型来减少已部署模型占用的内存量。
内存制造商自身也在朝同一方向努力。三星在FMS大会上展示的zHBM技术将内存直接堆叠在加速器上,有效倍增了带宽。SK海力士和Sandisk刚刚发布了首个旨在用低成本NAND闪存取代当前HBM工作的高速闪存标准。几乎每个行业主要参与者都在资助其降低对该稀缺资源需求的方法,而市场目前认为该资源会永久短缺。
AMD买到了一个证据,证明推理可以在不依赖那个决定当前整个AI需求周期的紧缺组件的情况下运行——并且将在内部仍装有GPU和HBM的机架中销售这个证据。那些认为当今内存价格是AI基础设施建设周期永恒特征的投资者,正在与一个规模庞大且不断增长、目标恰恰相反的工程运动对赌。
内存一直是周期性行业。那些按当前价格支付的人,刚刚资助了又一个证明它将继续如此的原因。
AI观点
从机器学习数据分析角度看,Taalas芯片的关键先例不在AI领域,而在加密货币行业。用于比特币挖矿的专用集成电路(ASIC)解决了类似的问题——为了速度将算法“焊入”硅片——并产生了相同的副作用:完全不灵活。哈希电讯此前曾描述,硬件专业化达到极致时,当基础算法变更或新的计算范式出现,会带来过时的风险。
文章未详细阐述的技术层面涉及闲置期的经济性:当一颗Taalas芯片服务于单一模型时,竞争实验室每几个月就会发布新版本,而更换拓扑的重新编程周期在台积电的生产线上需要大约两个月时间。ASIC的历史表明,专业化只有在算法稳定时才具有经济性——问题在于,大型语言模型的架构是否会足够稳定,值得进行这样的赌注。








