# 开源的所有文章

在 HTX 新闻中心浏览与「开源」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

给Transformer变个形,LLM竟能变得更聪明

一篇名为《给Transformer变个形,LLM竟能变得更聪明》的文章介绍了一项来自Mila、康奈尔大学和蒙特利尔大学研究者的新工作。该研究提出了“锥形语言模型”概念,其核心思想是:在模型总参数量和计算量不变的前提下,不再为所有网络层均匀分配参数,而是让参数容量(如前馈网络宽度)沿着模型深度方向单调递减。 研究发现,传统Transformer等架构对所有层“一视同仁”的参数分配方式可能并非最优。多项前期研究已表明,模型的浅层和深层在功能与重要性上存在差异。研究者通过实验证实,将更多容量集中到模型前段的“头重脚轻”式分配,相比均匀分配或集中于后段的方案,能显著降低模型在验证集上的困惑度,提升预测准确性。 在440M参数的模型上,最优的余弦递减配置(前段宽度为基准1.5倍,后段为0.5倍)使困惑度改善了1.84点。这一结论在多种不同架构和更大规模的模型上也得到了验证,且未损害模型处理长上下文的能力。分析显示,深层网络更多是在“重复强调”已有信息,而非创造新理解,因此前段层更能有效利用额外容量。 这项研究指出了一个长期被忽视的设计维度:参数容量的分布形状本身就是一个有效的优化杠杆。它为提升模型性能提供了一个几乎零成本的思路,无需改变架构或增加参数,仅需重新分配已有参数。研究者认为,这一思路未来可能同样适用于视觉Transformer、扩散模型等其他领域。

marsbit06/29 12:53

给Transformer变个形,LLM竟能变得更聪明

marsbit06/29 12:53

美国大模型走向封闭,以安全之名

2026年6月,美国政府以安全为由,对前沿AI模型的发布实施管制。Anthropic的最强网络安全模型Mythos 5被要求下架后,仅获准有限恢复至约100家美国机构,其公众版Fable 5恢复时间未定。同时,OpenAI发布的新模型GPT-5.6系列也只对经政府审批的合作伙伴开放API。此事标志着美国政府首次成功介入商业AI模型的发布审批。 然而,涉事公司的安全评估显示,模型并未越过其自设的风险红线。OpenAI评估其模型不具备自主实施端到端网络攻击的能力;Anthropic则反驳政府的担忧基于一个狭窄、非通用的漏洞。行业批评政府的决策缺乏清晰的技术标准和透明的流程。有观点认为,管制行动的背后是模型能力的“可演示性”引发了政治担忧、竞争对手的举报以及新AI行政令寻求执法案例的需求。 文章回顾了上世纪90年代的“密码战争”,当时美国政府试图管制强加密技术的出口,最终因技术扩散无法遏制、损害美国企业竞争力而失败。历史镜鉴提示,对前沿AI的类似管制可能阻碍技术创新与产业投资,并将市场优势让位于以开源开放策略发展的竞争者。 评论指出,一个没有明确标准和时间表的审批流程,可能动摇前沿AI产业的商业逻辑,并将强大工具的访问权集中于少数特权机构,反而可能增加风险。全球开发者社区开始怀念模型自由发布、快速创新的时代,并将更多期待转向持续开放的中国大模型。

链捕手06/27 15:21

美国大模型走向封闭,以安全之名

链捕手06/27 15:21

活动图片