生成模型也能端到端训练了?核心竟是一个for循环

marsbit发布于2026-08-03更新于2026-08-03

文章摘要

长期以来,深度学习在图像分类、检测等任务上凭借端到端训练取得了巨大成功,但生成模型领域却始终是个例外。当前主流的自回归、扩散模型等训练时只学习预测“一小步”,推理时则需要反复展开数百上千步,这种训练与推理的不一致导致了“暴露偏差”等问题,使得生成模型一直未能实现真正的端到端训练。 最近,一篇来自UIUC与哈佛大学的论文提出了“探索式建模(Explorative Modeling,XM)”新范式,其核心是一个简单到近乎朴素的for循环:在每个训练步骤中,模型生成K个候选样本,然后仅选取其中最接近真实数据的一个样本来计算损失和回传梯度。这种做法巧妙地绕开了传统生成模型中因使用重构损失(如平方误差)而导致的“模态模糊”问题——即模型倾向于输出多个可能答案的平均值,而这个平均值往往不属于任何真实的数据模式。 XM通过这种方式,在不拆分生成过程的前提下,直接提升了模型的“生成表达力”,即模型捕捉数据分布中多个独立模式的能力。论文将“探索”验证为继模型参数量、数据量之后的第三根可扩展轴。实验表明,随着模型规模、数据量和计算量的增大,探索带来的性能收益越发显著,在图像、视频、语言等多种任务上均能带来效率与质量的提升。 更重要的是,当探索程度足够时,XM可以实现真正的端到端生成。在机器人控制等任务中,仅需一次网络前向传播的XM策略,其性能可媲美甚至超过需要上百次前向的扩散模型策略,实现了推理效率的飞跃。 尽管“最佳K样本选择”的思想并非全新,但该研究的贡献在于清晰地揭示了这一简单机制如何直接解决生成模型的核心瓶颈,并为实现高效、端到端的生成模型开辟了新的可能性。随着模型规模的持续扩大,探索这一新维度可能将发挥越来越关键的作用。

2012 年,AlexNet 用一场压倒性的胜利终结了一个时代。在此之前,做图像识别要靠人手工设计一层层特征提取的流程;AlexNet 证明了一件后来被反复验证的事:把整个任务端到端地交给模型自己学,几乎总是打得过人类精心设计的分阶段流水线。

从图像分类到目标检测再到图像分割,深度学习的每一次跃迁背后,都是同一句话:让它自己一口气学完。

只有一个领域始终是例外:生成模型。

今天最强、最能扩展的生成模型(无论是自回归还是扩散模型)都不是端到端的。

它们训练时只学预测「一小步」,推理时却要像循环网络那样把这一步反复展开几百上千次。

训练和推理用的不是同一套采样方式。这个裂缝带来了一个老问题:每一步的误差会喂进下一步,输入逐渐漂离训练时见过的分布,误差层层累积。学术上管它叫「暴露偏差」(exposure bias)

换句话说,「端到端更好」这条深度学习最核心的经验,十几年来始终没能真正落到生成模型头上。

而就在最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。

作者给这个新范式起了个名字,叫Explorative Modeling(探索式建模),模型简称XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴

项目网站:https://explorative-modeling.github.io

论文地址:https://arxiv.org/abs/2607.27372

代码仓库:https://github.com/alexiglad/XM

问题的根源:模型只会「取平均」

要理解这篇论文在解决什么,得先理解生成到底难在哪。

普通的监督学习(比如分类)每个输入基本只有一个正确答案,模型学一个确定的映射就够了。

但生成不一样。你让模型「生成一只狗」,正确答案甚至可能有无穷多个。这些合法的输出,就是数据分布里的一个个 mode(即分布中一个个独立的峰)。生成难,正是因为要同时抓住这么多 mode。

麻烦在于,主流生成模型训练时用的是重构损失(比如平方误差)。当一个输入被随机配上了许多个不同的合法目标,重构损失能给出的最优解,是这些目标的平均值。而对绝大多数数据来说,平均值根本不在数据流形上,而落在几个 mode 中间,谁也不像。

论文里那张图很直观:让模型在没有任何技巧的情况下直接端到端地回归,三堆散点会被它预测成正中间的一个点,一张狗的照片会糊成一团,一句话会退化成把「the」重复到底。这就是「mode 模糊」(mode blurring),即最优解恰恰是最不像真实数据的那个答案。

现有模型是怎么绕过去的?答案是把「生成」这件事拆碎。自回归一次只预测一个元素,扩散一次只去掉一点噪声,每一小步的目标都被切到几乎只剩单一 mode,于是重构损失就不会再去取平均。

这套「拆分生成过程」正是扩散和自回归能做出高质量样本的原因,但也正是它,让模型没法端到端。

作者由此提出了一个关键的追问:一个生成模型只有两样东西可以拆,一个是怎么生成,一个是怎么训练。

既然拆生成这条路会毁掉端到端,那为什么不去拆训练呢?

一个 for 循环:探索式建模的全部内核

Explorative Modeling 拆的就是训练循环本身。

它的机制可以用一句话说清:在每一个训练步,模型不再只生成一个样本去硬凑目标,而是生成 K 个候选,然后只挑其中离真实数据最近的那一个来训练、回传梯度。论文里把它实现成一个 3 到 5 行的 for 循环,简单到有点让人怀疑(Algorithm 1)。

为什么这么做就能解决 mode 模糊?

换个生活里的场景:猜飞镖落点。如果只让你猜一次,你的最优策略是猜所有飞镖的平均位置,可那往往是靶盘上根本没几支飞镖扎中的地方。但如果允许你猜 K 次、且只按最接近的那一次算分,最优策略立刻变了:你会把这几次猜测散开,让每一次去覆盖一簇不同的落点。

模型也是一样。当它被允许探索 K 个候选,不同的输入噪声就会各自「认领」一个不同的 mode,而不是全都挤到中间去取平均。探索多少次,模型就能稳稳抓住多少个 mode。

作者给这个被长期忽视的能力起了个名字:生成表达力(generative expressivity),并指出它由训练目标本身决定,无论你把参数和数据堆到多大,它都不会自己涨上去。

这也解释了一个业内早就观察到的怪现象:为什么今天最好的模型都那么依赖「引导」(guidance)技术。

所谓无分类器引导,本质是把预测「推离」那个模糊的平均值。但如果模型自己不糊,又何必去推它? 引导之所以有用,恰恰是 mode 模糊留下的病根。

论文还给出了ForwardReverse两种探索方向:前者固定一个真实目标、在自己的生成里搜最近的一个,偏向「查全」(覆盖所有 mode);后者固定一个生成、在真实数据里搜最近的一个,偏向「查准」,且几乎不增加算力开销,代价是可能塌缩到少数 mode。两者互补,可以组合使用。

第三根轴:越放大,收益越大

这篇论文最有分量的结论,是把「探索」验证成了一根真正的 scaling 轴

作者把探索加到扩散/流模型、Jumpy 模型乃至掩码扩散语言模型上,在图像、视频、语言三种模态上一致地看到性能单调提升。更关键的是收益随规模的走向:越放大越猛。

论文给出的数字是:随着数据规模增长,探索带来的增益从 7% 一路爬到 36%;随着模型增大,从 13% 爬到 23%;当算力翻到三倍时,效率增益直接翻了一倍多。

具体到效率上,探索把 FLOP 效率提升了 4.1 倍、样本效率提升了 6.2 倍、参数效率提升了 47%。在图像生成上,它把当前最强的 RAE 配方进一步推到了 ImageNet 上无引导 1.43 的 FID,逼近业界最好水平。

一个探索 5 个 mode 的 Large 模型,甚至能跑赢一个多了 47% 参数却不做探索的 XLarge 模型。

这个走向的含义并不小。作者的解释是:小规模时,模型主要被参数和数据卡着,生成表达力还不是瓶颈;可一旦参数和数据放大到「不再是限制」的地步,生成表达力就会越来越成为那个真正的瓶颈。而它正是探索能直接放大的东西。

考虑到当下真正的基础模型训练,用的算力比这篇论文最大的实验还高出约四个数量级,作者认为论文里报出的这些数字,很可能只是更大规模下收益的下限

真正端到端的生成

如果把探索推到极限,会发生什么?答案回到了开头那个悬念:生成模型终于可以端到端了

作者把 XM 当作独立的端到端模型,拿去做机器人控制任务。在行为克隆(Behavior Cloning)上,他们的 Explorative Policy 只用一次网络前向就追平甚至超过了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模上,Explorative World Model 用比 Diffuser 少 16 到 256 倍的推理算力,做到了更好的平均表现。

这个差距的来源很清晰:扩散模型是在推理时用几百步生成来换取表达力,而端到端的 XM 把这笔账挪到了训练时的探索上,推理因此只需一次前向。「处理多 mode」这同样一件事,要么在推理时慢慢拆,要么在训练时一次探索到位;这篇论文选择了后者。

作者介绍

这篇论文的第一作者Alexi Gladstone并不是生面孔。就在 2025 年 7 月,他主导的Energy-Based Transformers(EBT)曾在社交平台上引发过不小的讨论。

那项工作声称首次在多个维度上「跑赢」了标准前馈 Transformer 的扩展曲线,并试图把「System 2 思考」推广到任意 mode。参阅机器之心报道《新范式来了!新能量模型打破 Transformer++扩展上限,训练扩展率快 35%》。

Explorative Modeling 与他一贯的思路一脉相承:都在追问「模型能不能通过某种搜索、探索的方式,去做单次前向做不到的事」。而这篇论文更是建立在他与合作者(Yilun Du 和 Heng Ji)的另一套理论Mode Forcing之上。论文里坦言,正因为有那套理论在先,XM 的大部分结果是先被理论预测、再被实验验证的,这在以「跑完实验再解释」为常态的深度学习圈里,并不多见。

作者也很坦诚地承认了局限:best-of-K 这个想法本身并不新,前人做过很多次;他们真正的贡献,是想清楚了这个简单循环到底在做什么:它在不拆分生成过程的前提下,直接放大了生成表达力。

此外,自回归语言模型目前仍是最难啃的骨头,纯端到端的 Forward XM 在极度多 mode 的分布(比如图像生成)上还太贵,这些都留给了后续工作。

十几年来,我们习惯了用两个旋钮去调生成模型:把它做得更大,喂它更多数据。

这篇论文提出的第三个旋钮相当朴素:让模型多猜几次、只留最好的一次。但如果它揭示的趋势成立,那么随着规模继续膨胀,前两个旋钮迟早会拧到头,而第三个才刚刚开始转动。

参考链接

https://x.com/AlexiGlad/status/2083230922196107288

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:Panda

热门币种推荐

相关问答

Q什么是生成模型中的“暴露偏差”(exposure bias)?

A“暴露偏差”是生成模型训练与推理方式不一致导致的问题。主流生成模型训练时只学习预测一个“小步骤”(如自回归模型预测下一个token,扩散模型预测一步噪声),但在推理时需要将这个步骤循环展开数百上千次。由于推理时每一步的输入会逐步偏离训练时见过的分布,导致每一步的微小误差层层累积,最终影响生成样本的质量。

QExplorative Modeling (XM) 的核心方法是什么?

AExplorative Modeling (XM) 的核心是在训练过程中引入一个简单的for循环进行“探索”。具体来说,在每一个训练步,模型不再是生成单个样本来拟合目标,而是生成K个候选样本,然后只挑选其中与真实数据最接近的那个样本来计算损失并回传梯度。这种方法迫使模型在一次训练步骤中探索并覆盖多个可能的目标(或“模式”),从而解决了多模态数据分布下直接使用重构损失会导致“模式模糊”的问题。

Q论文中提到的“生成表达力”(generative expressivity)是什么?

A“生成表达力”是论文中提出的一个概念,指模型能够同时捕捉数据分布中多个不同“模式”的能力。传统使用重构损失的模型,当面对一个输入对应多个合法输出时,其最优解是输出这些目标的平均值,导致生成结果模糊、缺乏多样性。这种表达能力由训练目标本身决定,不能通过单纯增加模型参数或数据规模来提升。Explorative Modeling 通过训练时的探索,直接增强了模型的生成表达力。

QForward 和 Reverse 两种探索方向有什么区别?

AForward探索和Reverse探索是XM中两种互补的探索策略。Forward探索:固定一个真实数据目标,在模型生成的K个候选样本中,寻找与这个真实目标最接近的一个来训练。这种方法偏向于“查全”,旨在让生成尽可能覆盖数据分布中的所有模式,但计算成本较高。Reverse探索:固定模型生成的一个候选样本,在训练数据中寻找与其最接近的真实样本进行训练。这种方法偏向于“查准”,能确保生成的样本更接近真实数据中的某个模式,且计算成本几乎不增加,但可能导致模型塌缩到少数几个模式上。两者可以组合使用。

QExplorative Modeling 在实验中展现出怎样的扩展性收益?

A实验表明,“探索”本身可以成为继模型规模(参数)和数据规模之后,生成模型的第三根有效的扩展轴。随着模型规模、数据规模或计算预算的增加,使用探索带来的性能增益(如图像生成的FID指标提升)也单调递增。例如,当数据规模增长时,探索带来的增益从7%爬升到36%;当模型变大时,增益从13%爬到23%。一个探索5个模式的大型模型,其性能可以超越一个参数多47%但不做探索的超大型模型。这表明,在规模足够大时,生成表达力将成为关键瓶颈,而探索是直接解决这一瓶颈的有效手段。

你可能也喜欢

Rubin Ultra大减配,英伟达也扛不住内存涨价了?

知名投研机构SemiAnalysis近日报告指出,英伟达已向主要客户预览了其顶级AI芯片Rubin Ultra的最新规格,但相比此前预期出现显著降配。核心变化包括:算力峰值保持与普通版Rubin相同的35 PFLOPs;显存容量降至8层堆叠的192GB,甚至低于普通版的288GB;显存带宽仅微升1TB/s;芯片功耗反而略有提高。Rubin Ultra的主要升级方向转向“扩展互联规模”,支持通过NVLink将最多576张GPU互联成统一计算域,远高于普通版的72张。 报告分析认为,此次调整主要源于HBM(高带宽内存)价格持续快速上涨。以HBM3为例,其价格已从2025年二季度的低点180-220美元,飙升至目前约700-850美元。HBM成本飙升使得Rubin Ultra单机架的物料成本一度从约660万美元升至800万美元。英伟达因此重新评估设计,通过减少昂贵的HBM配置(成本占比从近40%降至28%),将资源更多投入互联能力等方向,优化整体成本结构。 此消息引发市场对HBM需求见顶的担忧。受冲击影响,韩国存储股开盘大跌,SK海力士、三星股价均下挫约8%。市场解读认为,若英伟达此举成为趋势,意味着AI芯片厂商可能开始通过优化设计来降低对高容量HBM的依赖,这或将限制存储厂商未来的提价空间,标志着AI基础设施的“堆料涨价”时代可能接近尾声。

Odaily星球日报8分钟前

Rubin Ultra大减配,英伟达也扛不住内存涨价了?

Odaily星球日报8分钟前

年薪百万抢电工,Meta急到自己办技校

AI竞赛正面临新的瓶颈:工地。美国正面临严重的电工、建筑工等技术工人短缺,这已成为微软、Meta、OpenAI等公司快速建设超大规模AI数据中心(如OpenAI耗资160亿美元的“星际之门”项目)的“头号障碍”。 尽管AI公司愿支付高薪(如电工年薪可达24-28万美元),远超传统行业,但熟练技工仍供不应求。麦肯锡预测,美国在2023-2030年间需额外培养13万名电工和24万名建筑工,而劳工统计局预计每年仍有8万个电工岗位空缺。这种短缺导致项目延迟,每月可能造成数百万美元的收入损失。 AI数据中心建设复杂,需应对巨大功耗(一座设施耗电堪比数十万户家庭)、复杂的配电系统以及高密度散热(需液冷技术)等挑战,因此亟需大量技术娴熟的工人。 为此,科技巨头开始亲自下场培养人才。例如,Meta投入1.15亿美元建立建筑工人培训学校,提供免费培训及生活补贴,以快速输送工人上岗。OpenAI则与建筑工会合作,提前锁定熟练劳动力。同时,企业也将招聘目光投向高中生,鼓励年轻人投身技工行业。这些举措已见成效,Z世代对技工职业的兴趣显著上升。 然而,更深层的挑战在于电力。AI数据中心用电量正以惊人速度增长,已推高部分地区的电价。此外,数据中心建设是项目制的,建设期需要成千上万的工人,但建成后仅需少量常驻人员。这意味着未来可能面临熟练工人短期过剩、并流向其他行业压低薪资的风险。如何实现劳动力与电力资源的长期平衡,仍是悬而未决的问题。

marsbit2小时前

年薪百万抢电工,Meta急到自己办技校

marsbit2小时前

交易

现货

热门文章

如何购买CORE

欢迎来到HTX.com!我们已经让购买Core DAO(CORE)变得简单而便捷。跟随我们的逐步指南,放心开始您的加密货币之旅。第一步:创建您的HTX账户使用您的电子邮件、手机号码注册一个免费账户在HTX上。体验无忧的注册过程并解锁所有平台功能。立即注册第二步:前往买币页面,选择您的支付方式信用卡/借记卡购买:使用您的Visa或Mastercard即时购买Core DAO(CORE)。余额购买:使用您HTX账户余额中的资金进行无缝交易。第三方购买:探索诸如Google Pay或Apple Pay等流行支付方法以增加便利性。C2C购买:在HTX平台上直接与其他用户交易。HTX场外交易台(OTC)购买:为大量交易者提供个性化服务和竞争性汇率。第三步:存储您的Core DAO(CORE)购买完您的Core DAO(CORE)后,将其存储在您的HTX账户钱包中。您也可以通过区块链转账将其发送到其他地方或者用于交易其他加密货币。第四步:交易Core DAO(CORE)在HTX的现货市场轻松交易Core DAO(CORE)。访问您的账户,选择您的交易对,执行您的交易,并实时监控。HTX为初学者和经验丰富的交易者提供了友好的用户体验。

1.4k人学过发布于 2024.05.09更新于 2026.06.02

如何购买CORE

相关讨论

欢迎来到HTX社区。在这里,您可以了解最新的平台发展动态并获得专业的市场意见。以下是用户对CORE(CORE)币价的意见。

活动图片