# 架构的所有文章

在 HTX 新闻中心浏览与「架构」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

给Transformer变个形,LLM竟能变得更聪明

一篇名为《给Transformer变个形,LLM竟能变得更聪明》的文章介绍了一项来自Mila、康奈尔大学和蒙特利尔大学研究者的新工作。该研究提出了“锥形语言模型”概念,其核心思想是:在模型总参数量和计算量不变的前提下,不再为所有网络层均匀分配参数,而是让参数容量(如前馈网络宽度)沿着模型深度方向单调递减。 研究发现,传统Transformer等架构对所有层“一视同仁”的参数分配方式可能并非最优。多项前期研究已表明,模型的浅层和深层在功能与重要性上存在差异。研究者通过实验证实,将更多容量集中到模型前段的“头重脚轻”式分配,相比均匀分配或集中于后段的方案,能显著降低模型在验证集上的困惑度,提升预测准确性。 在440M参数的模型上,最优的余弦递减配置(前段宽度为基准1.5倍,后段为0.5倍)使困惑度改善了1.84点。这一结论在多种不同架构和更大规模的模型上也得到了验证,且未损害模型处理长上下文的能力。分析显示,深层网络更多是在“重复强调”已有信息,而非创造新理解,因此前段层更能有效利用额外容量。 这项研究指出了一个长期被忽视的设计维度:参数容量的分布形状本身就是一个有效的优化杠杆。它为提升模型性能提供了一个几乎零成本的思路,无需改变架构或增加参数,仅需重新分配已有参数。研究者认为,这一思路未来可能同样适用于视觉Transformer、扩散模型等其他领域。

marsbit06/29 12:53

给Transformer变个形,LLM竟能变得更聪明

marsbit06/29 12:53

越过“内存墙”,AI推理时代的晶圆级革命与算力路线

2026年,AI产业进入新拐点:全球主要云厂商的推理资本支出首次超过训练。这意味着算力需求核心从“炼模型”转向“用模型”,瓶颈也从计算规模变为“内存墙”——即数据在GPU与片外存储间搬运带来的高能耗与延迟。 为突破内存墙,Cerebras公司选择了“晶圆级计算”的激进路线。其核心产品WSE-3不切割晶圆,直接制成超大芯片,集成90万个AI核心和44GB片上SRAM,带来远超传统GPU(如英伟达B200)的片上内存带宽。其架构将模型权重存储于片外MemoryX,按需流式传输至芯片计算,从而在LLM推理,尤其是首token延迟和长上下文任务中展现出显著优势,token生成速率可达GPU的1.5-5倍。同时,其芯片内互联功耗也远低于当前GPU。 但这种极致物理优化也带来挑战:通过先进制程提升SRAM容量的路径已近天花板;整片晶圆发热量大,需专用液冷;片外I/O带宽有限,难以高速扩展形成大规模集群;软件生态也与主流CUDA不兼容。 与此同时,行业巨头正通过多条路径围剿:1)自研ASIC推理芯片(如谷歌TPU、微软Maia);2)利用台积电SoW等先进封装技术将“晶圆级”能力通用化、平民化;3)探索光互联/光计算作为终极解决方案。 Cerebras还面临商业转型的挑战,巨额订单迫使其从芯片商转向云服务商,需快速建设专用数据中心,交付压力巨大。 最终,AI推理时代的算力架构呈现路线分野:Cerebras向左,追求单任务下的极致低延迟;英伟达向右,以通用性应对多变负载。技术变革仍在继续,谁将主导未来,尚无定论。

marsbit06/05 11:07

越过“内存墙”,AI推理时代的晶圆级革命与算力路线

marsbit06/05 11:07

GitHub,被 AI 打穿了

2026年2月9日,GitHub发生大规模服务中断,核心数据库集群因“缓存重写风暴”过载,导致网站、API、Actions及Copilot等服务瘫痪。事故根源是一个配置改动(缓存刷新时间从12小时改为2小时),但背后是平台面临的结构性挑战。 2026年前三个月,GitHub发生至少8次重大事故,故障原因各异但相互关联。深层原因是AI Agent的爆发式使用导致负载性质剧变。数据显示,2026年单周代码提交量达2.75亿次,按此推算全年将达140亿次,是2025年的14倍。AI贡献的提交量和PR数量在数月内增长数十倍。这些不眠不休的AI“用户”以远超人类的速率提交代码、创建仓库,使GitHub的负载模式从可预测的人类节奏转变为持续高压的自动化洪流。 同时,AI Agent(尤其是Agentic工作流)消耗的计算资源远超预期,使GitHub基于座位的Copilot订阅模式严重亏损。GitHub不得不实施限流,并于6月1日全面转向按用量计费。 为应对挑战,GitHub宣布需按当前规模的30倍重新设计架构,而非简单扩容,重点包括解耦服务、增强故障隔离、改进流量管控等。行业如Stripe、AWS也面临类似问题。 本质上,GitHub正从“人类协作平台”转变为“AI工作流的输出管道”。这不仅是基础设施的压力测试,也引发对其商业模式和核心身份的重塑。频繁的事故报告和高透明度,是平台在重建过程中争取社区耐心的方式。这次停机事件标志着软件开发在AI时代的一次深刻转折。

marsbit06/04 10:39

GitHub,被 AI 打穿了

marsbit06/04 10:39

活动图片