# 深度学习的所有文章

在 HTX 新闻中心浏览与「深度学习」相关的最新资讯与深度分析。潘盖市场趋势、项目动态、技术进展及监管政策,提供权威的加密行业洞察。

给Transformer变个形,LLM竟能变得更聪明

一篇名为《给Transformer变个形,LLM竟能变得更聪明》的文章介绍了一项来自Mila、康奈尔大学和蒙特利尔大学研究者的新工作。该研究提出了“锥形语言模型”概念,其核心思想是:在模型总参数量和计算量不变的前提下,不再为所有网络层均匀分配参数,而是让参数容量(如前馈网络宽度)沿着模型深度方向单调递减。 研究发现,传统Transformer等架构对所有层“一视同仁”的参数分配方式可能并非最优。多项前期研究已表明,模型的浅层和深层在功能与重要性上存在差异。研究者通过实验证实,将更多容量集中到模型前段的“头重脚轻”式分配,相比均匀分配或集中于后段的方案,能显著降低模型在验证集上的困惑度,提升预测准确性。 在440M参数的模型上,最优的余弦递减配置(前段宽度为基准1.5倍,后段为0.5倍)使困惑度改善了1.84点。这一结论在多种不同架构和更大规模的模型上也得到了验证,且未损害模型处理长上下文的能力。分析显示,深层网络更多是在“重复强调”已有信息,而非创造新理解,因此前段层更能有效利用额外容量。 这项研究指出了一个长期被忽视的设计维度:参数容量的分布形状本身就是一个有效的优化杠杆。它为提升模型性能提供了一个几乎零成本的思路,无需改变架构或增加参数,仅需重新分配已有参数。研究者认为,这一思路未来可能同样适用于视觉Transformer、扩散模型等其他领域。

marsbit06/29 12:53

给Transformer变个形,LLM竟能变得更聪明

marsbit06/29 12:53

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

世界模型是当前AI领域的热门概念,旨在让机器像人类一样,在行动前通过“脑内沙盘”预演和推演未来。其核心思想可追溯至1943年心理学家Kenneth Craik提出的“心智模型”,以及AI先驱Marvin Minsky的“框架理论”。2018年,David Ha与Jürgen Schmidhuber的论文将这一概念带入深度学习主流。 当前,学界和产业界对世界模型的定义尚未统一。Yann LeCun强调其应理解物理规律,提出JEPA架构;李飞飞则基于POMDP框架,将世界模型分为渲染器、模拟器和规划器三类;清华大学FIB-Lab将其功能归纳为“理解世界”与“预测未来”。OpenAI的Sora、Google DeepMind的Genie 3、英伟达的Cosmos等大厂产品,分别从视频生成、3D交互、物理仿真等角度切入。 技术路线主要分为三类:一是“画画”路线,即生成式视频模型,视觉逼真但物理一致性弱;二是“心算”路线,预测抽象表征,效率高但可解释性差;三是“搭积木”路线,生成精确的三维环境,可控但泛化能力有限。发展趋势是三者融合,并向World Action Model(WAM)演进,实现状态预测与动作生成的联合学习。 产业链已形成基础支撑层、技术平台层和场景应用层三层结构,在自动驾驶、具身智能等领域应用广泛。尽管概念尚未统一,但这反映了技术早期的多元探索,最终目标都是让机器拥有可推演、可泛化的内部世界模型,以实现更安全、高效和通用的智能行为。

marsbit06/29 05:08

世界模型概念入门:一个从心理学烧到 AI 主战场的故事

marsbit06/29 05:08

如何用 Claude 的 Dynamic Workflows 做深度研究

做技术调研容易陷入信息过载和结论模糊的陷阱。AI虽执行力强,但易困于当前信息且跨界联想弱。Claude近期推出的Dynamic Workflows(动态工作流)功能,旨在通过AI自动设计并执行任务流程来提升深度研究能力。 其核心是六种工作流模式:1) 路由模式:由主Agent判断任务类型并分发给最专业的子Agent处理,精准高效但处理模糊任务能力弱;2) 拆分合并模式:将任务拆分为多个独立子任务并行执行后合并结果,速度快但Token成本高,合并有挑战;3) 对抗验证模式:让多个Agent从反驳角度挑战同一结论,基于多数票通过,能有效减少确认偏误,但需基于事实而非观点;4) 生成与过滤模式:先生成大量候选方案,再用预设标准筛选出最优,能提升多样性,但过滤标准至关重要;5) 锦标赛模式:多个Agent竞争同一任务,通过两两对比逐轮淘汰选出最优,评判更稳定;6) 循环模式:通过自适应迭代不断尝试直至满足条件,擅长处理边界未知的任务,但有失控风险。 相较于作者自建的深度研究技能,官方的动态工作流增加了关键环节:问题拆解、信息可信度评估、交叉删除(投票淘汰而非简单合并)以及目标导向的输出。这有效解决了AI长任务中的目标漂移、过早停止、上下文污染和输出偏向等问题。 总之,Dynamic Workflows将研究流程本身结构化,通过多Agent的智能调度,显著提升了研究的效率和结论的可靠性,将以往可能需要十几次对话的调研压缩到3-4次,尽管Token消耗大幅增加。但它仍有局限:在验证机制上可能过于依赖官方文档而非事实数据;对于完全跨界、数据不足的深度思考支持有限;在解决方案的验证与成本权衡上仍有不足;在针对不同受众进行信息极致浓缩方面也需进一步优化。

marsbit06/09 03:07

如何用 Claude 的 Dynamic Workflows 做深度研究

marsbit06/09 03:07

活动图片