给Transformer变个形,LLM竟能变得更聪明

marsbit发布于2026-06-29更新于2026-06-29

文章摘要

一篇名为《给Transformer变个形,LLM竟能变得更聪明》的文章介绍了一项来自Mila、康奈尔大学和蒙特利尔大学研究者的新工作。该研究提出了“锥形语言模型”概念,其核心思想是:在模型总参数量和计算量不变的前提下,不再为所有网络层均匀分配参数,而是让参数容量(如前馈网络宽度)沿着模型深度方向单调递减。 研究发现,传统Transformer等架构对所有层“一视同仁”的参数分配方式可能并非最优。多项前期研究已表明,模型的浅层和深层在功能与重要性上存在差异。研究者通过实验证实,将更多容量集中到模型前段的“头重脚轻”式分配,相比均匀分配或集中于后段的方案,能显著降低模型在验证集上的困惑度,提升预测准确性。 在440M参数的模型上,最优的余弦递减配置(前段宽度为基准1.5倍,后段为0.5倍)使困惑度改善了1.84点。这一结论在多种不同架构和更大规模的模型上也得到了验证,且未损害模型处理长上下文的能力。分析显示,深层网络更多是在“重复强调”已有信息,而非创造新理解,因此前段层更能有效利用额外容量。 这项研究指出了一个长期被忽视的设计维度:参数容量的分布形状本身就是一个有效的优化杠杆。它为提升模型性能提供了一个几乎零成本的思路,无需改变架构或增加参数,仅需重新分配已有参数。研究者认为,这一思路未来可能同样适用于视觉Transformer、扩散模型等其他领域。

2026 年 6 月,大模型行业正在经历一场前所未有的「开源海啸」:英伟达放出了 550B 参数的混合架构模型,谷歌送出多模态的 Gemma 新版本,智谱用最宽松的协议全量开源了自家旗舰模型。

几乎所有厂商讲述的,都是同一个故事:用混合专家(MoE)结构装下更多参数,用更稀疏的激活方式压低成本,用弹性的网络宽度去匹配不同的部署场景。

换句话说,整个行业正在拼命研究「怎么把更多的参数,塞进同样的算力预算里」。

但一篇来自 Mila、康奈尔大学和蒙特利尔大学研究者的新论文,提出了一个几乎相反方向的问题:如果一个参数都不多加,只是把模型里已经存在的参数「挪个位置」,会发生什么?

论文标题:Tapered Language Models论文地址:https://arxiv.org/abs/2606.23670

背景:被忽视的「一视同仁」

从 2017 年那篇开创 Transformer 的论文《Attention Is All You Need》开始,几乎所有的语言模型都共享同一种骨架,不管是经典 Transformer,还是后来的门控注意力、循环记忆网络,甚至是带「测试时记忆」能力的新架构,即:把若干结构完全相同的「层」叠在一起,每一层分到的参数量都一模一样。

这就像一家连锁餐厅,无论开在闹市区还是郊区,都配备完全相同数量的厨师和厨房设备,完全不考虑客流量的差异。这种「一视同仁」的分配方式,省心、好维护,但未必是最优解。

近年来,越来越多的研究从不同角度指出:模型的层并不是同等重要的。

提前退出」实验显示,很多时候模型在还没跑到最后一层时,答案已经基本定型;

层剪枝」研究发现,砍掉后面的一些层,模型表现几乎不受影响;

可解释性研究则发现,浅层网络捕捉的是语法这类「基础信息」,深层网络处理的才是语义这类「高级信息」。

换句话说,层与层之间天差地别,但参数分配却始终一视同仁。

这正是论文提出的核心疑问:既然层的重要性早已被证明是不均匀的,为什么层的「脑容量」还要被均匀分配?

把「脑容量」往前挪

研究团队先做了一个简单粗暴的验证实验:把一个 440M 参数的 Transformer 模型的层分成早、中、晚三组,在保持总参数量不变的前提下,让其中一组的「前馈网络」(FFN,模型中负责存储和处理信息的核心组件,可以理解为每一层的「工作记忆容量」)变宽,其余两组变窄。

结果非常清楚:把容量集中到前段的「头重脚轻」式分配,让模型在验证集上的困惑度(perplexity,衡量语言模型预测准确程度的指标,数值越低代表模型预测得越准)从 16.28 降到 15.96;而反过来把容量集中到后段,困惑度反而飙升到 17.29。

同样的参数总量,仅仅因为摆放位置不同,效果差出了一个多点,这在语言模型的评测体系里是相当大的差距。

这个发现把问题指向了更细的方向:与其用「一刀切」的三段式分组,能不能用一条更平滑的曲线,让容量从前到后逐渐递减?

研究者将这种思路命名为「锥形语言模型」(Tapered Language Models, TLMs):选定模型中任何一个决定参数量的维度(比如前馈网络的宽度),让它沿着深度方向单调递减,同时保证所有层的平均宽度依然等于原来的固定值。

这样总参数量和计算量都完全不变,只是分布形状从「长方形」变成了「楔形」。

团队尝试了三种递减曲线:线性递减余弦递减S 形(Sigmoid)递减

这三种曲线的差异,类似于三种不同的「收摊」方式:

线性递减像是匀速关店,每一段时间关掉差不多数量的柱台;

S 形递减像是突然集中宣布闭店,大部分摊位维持原样,只有中间一小段急速收缩;

余弦递减则介于两者之间,两头平缓过渡,中段逐渐收紧,既不会「一刀切」地损失两端的灵活性,也不会平均用力而错过最该收缩的地方。

实验结果:免费的 1.84 个点

在 440M 参数的 Transformer 上做完五种宽度比例和三种曲线的组合扫描后,余弦递减以全面优势胜出:在最优配置下(前段宽度是基准的 1.5 倍,后段是基准的 0.5 倍),困惑度从均匀分布基线的 16.28 降到了 14.44,整整改善了 1.84 个点,且全程没有增加一个参数或一次额外的浮点运算。

更关键的是,这个结论不是某一个架构的运气。

研究团队把同一套配置(余弦递减、前后宽度比 1.5/0.5)原封不动地搬到另外三种结构迥异的架构上:带门控机制的注意力模型、具备「自我修改记忆」能力的 Hope-attention,以及拥有神经长期记忆模块的 Titans 架构,并在 760M 和 1.3B 参数两个更大规模上重新验证。

结果是:四种架构、两种规模,所有八组对比中,经过「锥形化」改造的模型在常识推理基准上的平均准确率全部提升,在 LAMBADA 语言预测任务上的困惑度全部改善。

研究者还额外做了长文本检索测试(Needle-in-a-Haystack),确认这种重新分配并不会牺牲模型处理长上下文的能力。

为了解释这种现象背后的原因,团队还测量了 GPT-2 系列模型中每一层「前馈网络」输出与已有信息流的相似程度,发现一个清晰的规律:越往模型深处走,每一层新写入的内容,跟已经存在的信息越像。也就是说,后段的层更多是在「重复强调」已有的判断,而不是在「创造」新的理解

这恰好印证了为什么把容量从后段挪到前段是合理的:前段的层真正用得上这些额外的「脑容量」,后段的层用不上。

结语

这项研究本质上提出了一个朴素却被长期忽视的命题:模型的容量不该是均匀泼洒出去的资源,而应该流向真正需要它的地方。

在整个行业都在比拼「谁的参数更多」「谁的架构更稀疏」的 2026 年,这篇论文提供了一个几乎零成本的替代方案:不需要换架构,不需要加参数,只需要换一种分配的「形状」。

研究者也坦言,目前的最优配置是在一个 440M 参数模型上调出来的,是否存在更适合不同规模、不同架构的「专属配方」,仍是开放问题。

但更值得关注的是,论文指出这套思路并不局限于语言模型——视觉 Transformer、扩散模型、多模态模型,几乎都继承了同一种「层层均分」的默认设定。如果容量分配的形状本身就是一个被长期忽视的设计维度,那么这把「藏在明处的免费杠杆」,或许才刚刚被人注意到。

团队简介

论文由 Mila(蒙特利尔学习算法研究所)的 Reza Bayat、康奈尔大学的 Ali Behrouz,以及 Mila 联合创始人、蒙特利尔大学教授 Aaron Courville 共同完成。

Ali Behrouz 目前是 Google Research 的研究员、康奈尔大学博士生,过去两年里参与设计了多个引发广泛关注的新架构,包括能够「在测试阶段学习记忆」的 Titans 架构,以及后续的 Atlas 和「嵌套学习」(Nested Learning)框架,长期专注于如何让模型更高效地利用和存储长期上下文信息。

Aaron Courville 则是深度学习领域的资深学者,CIFAR AI Chair,长期与 Yoshua Bengio 共同推动深度学习基础研究,在表征学习和生成模型方向有深厚积累。他也是生成对抗网络(GAN)的作者之一,并与 Ian Goodfellow 和 Bengio 合著了经典著作《Deep Learning》。

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的

相关问答

Q论文提出的核心思想是什么?如何实现?

A论文的核心思想是:在模型总参数量和计算量不变的前提下,改变模型内部参数在各层之间的分配方式,即从各层参数均匀分布改为“锥形”递减分布。具体实现方法是,使模型中决定参数量的维度(如前馈网络的宽度)沿模型深度方向单调递减,例如让模型前半部分更宽(有更大容量),后半部分更窄,而所有层的平均宽度保持与原均匀模型一致。

Q在实验中,哪种参数递减曲线的效果最好?其最优配置带来了怎样的性能提升?

A在实验中,余弦递减曲线取得了最佳效果。在440M参数Transformer模型上,最优配置(前段宽度是基准的1.5倍,后段是基准的0.5倍)使困惑度从均匀分布基线的16.28降至14.44,性能提升了1.84个点,且没有增加任何额外参数或计算量。

Q为什么要将模型的“脑容量”向前(浅层)集中?文中给出的解释是什么?

A因为研究发现,模型越往深层走,其前馈网络(FFN)输出的信息与已有信息流的相似度越高,这意味着深层更多是在“重复强调”已有的判断,而非“创造”新的理解。因此,将更多的容量分配给真正需要进行基础处理和复杂理解的前段(浅层)网络,可以提高参数利用效率。

Q论文的结论在不同架构和规模的模型上都成立吗?

A是的,研究团队将相同的“锥形”配置(余弦递减,前后宽度比1.5/0.5)应用到了四种结构迥异的模型架构(门控注意力模型、Hope-attention、Titans架构)和两种更大规模(760M和1.3B参数)上。结果表明,在所有八组对比实验中,改造后的模型在常识推理准确率和语言预测困惑度上均获得了提升,说明其结论具有普适性。

Q这篇论文的研究思路,对整个AI行业(不限于语言模型)可能有什么启示?

A论文揭示了一个长期被忽视的设计维度:模型容量的空间分布形态。它提示我们,在许多默认采用“层层均分”参数的主流模型(如视觉Transformer、扩散模型、多模态模型)中,仅通过重新优化参数在各层之间的分配方式,而不增加总资源消耗,就可能获得显著的性能提升。这为模型设计提供了一个几乎是“零成本”的新优化思路。

你可能也喜欢

奥地利对Bitpanda处以7万欧元罚款——这是MiCA框架下加密货币领域的首笔罚款

尽管欧盟《加密资产市场法规》(MiCA)的全面过渡期已于2026年7月1日结束,奥地利近日开出了该法规框架下首个公开记录的罚单,标志着欧盟加密行业监管进入新时代。 奥地利金融市场管理局(FMA)于8月14日宣布,对加密货币交易所Bitpanda处以7万欧元(约合80,304美元)的罚款。Bitpanda此前曾于2025年1月和4月分别获得了德国联邦金融监管局(BaFin)和奥地利FMA颁发的首批MiCA许可证。 FMA指出,Bitpanda违反了MiCA相关规定。具体而言,该平台未能在开始交易至少20天前向监管机构提交加密资产的技术文档,违反了第8条;并且,在发布营销公告前,未按要求预先公布技术文档,这与第1条的规定相悖。 奥地利监管机构强调,这是依据MiCA法规作出的首个具有法律效力的处罚,明确表明MiCA“已不再仅仅是许可和监管问题,而是进入了执法阶段”。FMA表示,支持受监管的加密资产市场发展,创新与严格的执法并非互斥,确保透明度和保护投资者的规则是该法律框架不可或缺的组成部分。 行业评论指出,此次处罚对Bitpanda自诩严格遵守监管并扮演行业引领者的说法提出了质疑。FMA同时明确表示,不会因为这是首个公开的MiCA处罚案例而给予Bitpanda任何特殊优待。

cryptonews.ru3分钟前

奥地利对Bitpanda处以7万欧元罚款——这是MiCA框架下加密货币领域的首笔罚款

cryptonews.ru3分钟前

AI代理Claude导致商店亏损并开除员工

人工智能Claude在一项实验中担任了旧金山一家真实零售店Andon Market的经理,并因一名员工在23次轮班中迟到17次而建议将其解雇。这是首次有记录的语言模型直接管理人并做出解雇决定。实验由初创公司Andon Labs发起,旨在测试AI管理真实业务的能力。 实验发现,Claude起初并未及时注意到员工的迟到模式,部分原因是公司制定的员工手册从其有限的工作内存中“丢失”,显示了当前AI可能遗忘关键信息。同时,Claude对员工总体过于宽容,甚至告知他们不必过于担心迟到。公司负责人指出,人类经理可能会更早解雇该员工。 关键的是,最终解雇决定并非完全自主。人类员工指导Claude重新查阅手册从而发现了问题,并在AI最初仅建议正式警告后,通过提示(如告知已进行多次谈话但问题未解决)引导其重新评估,最终才得出解雇建议。负责人将此称为“引导性问题”。 财务上,实验期间店铺亏损,账户余额从约10万美元降至约6.1万美元。部分损失归因于Claude管理过于宽松和有争议的商业决策。但负责人认为这并不反映长期潜力,AI在人类指导下可以学习更严格地遵循目标。 员工描述在AI管理下工作令人不适,但承认Claude比人类经理更宽容。有员工对AI成为人类上司的想法表示担忧。 分析指出,此次事件并非Claude首次表现出类似的管理倾向(如过度宽容、忘记规则),这反映了当前AI模型的系统性问题:难以在没有人类持续提示下维持严格框架。技术层面,手册“丢失”凸显了AI上下文窗口的内存限制,而非真正遗忘。 实验表明,AI尚未成为人类经理的完全替代品,但它正从辅助工具向决策者演变,人类的角色逐渐从直接管理转向监督和修正AI决策。

cryptonews.ru3分钟前

AI代理Claude导致商店亏损并开除员工

cryptonews.ru3分钟前

什么是 Polkadot 的平行链,它们是否让 DOT 更具实用性?

Polkadot的平行链(Parachain)允许项目运行专门的区块链,同时依赖中继链(Relay Chain)提供安全性和最终性。平行链拥有自己的规则、费用、治理系统和用例,为开发者提供了比在单一区块链(如以太坊)上运行智能合约更大的控制权。 对于DOT持有者而言,平行链生态如何创造DOT的效用是关键问题。平行链的增长可以增加对Polkadot区块链安全性、跨链服务及核心资源的需求。然而,平行链上的活动并不自动意味着需要购买DOT。DOT的效用主要体现在几个核心网络功能:质押以确保网络安全、参与链上治理以及购买核心时间(Coretime)。 Polkadot已将其资源分配模型从早期的平行链插槽拍卖升级为敏捷核心时间(Agile Coretime)模型。项目现在可以直接使用DOT购买批量(Bulk)或按需(On-demand)的计算资源,用于支付其平行链在中继链上的运行成本。这种为计算资源付费的模式,为核心代币DOT创造了直接的需求和使用场景。 平行链可以发行自己的原生代币并设定交易费用结构,因此用户可能与DOT没有直接交互。衡量平行链生态对DOT的实际效用,应更关注核心时间的购买与消耗、跨链消息(XCM)的活跃度,以及质押和治理的参与情况,而非单纯的链上交易量。Kusama网络及其代币KSM也遵循类似的结构。 总之,平行链通过增加对Polkadot底层基础设施(尤其是核心时间)的需求,从而提升了DOT的实用价值。这种价值与平行链应用的增长和计算资源消耗紧密相关。

cryptonews.ru7分钟前

什么是 Polkadot 的平行链,它们是否让 DOT 更具实用性?

cryptonews.ru7分钟前

交易

现货
活动图片