生成模型也能端到端训练了?核心竟是一个for循环

marsbitPublished on 2026-08-03Last updated on 2026-08-03

Abstract

长期以来,深度学习在图像分类、检测等任务上凭借端到端训练取得了巨大成功,但生成模型领域却始终是个例外。当前主流的自回归、扩散模型等训练时只学习预测“一小步”,推理时则需要反复展开数百上千步,这种训练与推理的不一致导致了“暴露偏差”等问题,使得生成模型一直未能实现真正的端到端训练。 最近,一篇来自UIUC与哈佛大学的论文提出了“探索式建模(Explorative Modeling,XM)”新范式,其核心是一个简单到近乎朴素的for循环:在每个训练步骤中,模型生成K个候选样本,然后仅选取其中最接近真实数据的一个样本来计算损失和回传梯度。这种做法巧妙地绕开了传统生成模型中因使用重构损失(如平方误差)而导致的“模态模糊”问题——即模型倾向于输出多个可能答案的平均值,而这个平均值往往不属于任何真实的数据模式。 XM通过这种方式,在不拆分生成过程的前提下,直接提升了模型的“生成表达力”,即模型捕捉数据分布中多个独立模式的能力。论文将“探索”验证为继模型参数量、数据量之后的第三根可扩展轴。实验表明,随着模型规模、数据量和计算量的增大,探索带来的性能收益越发显著,在图像、视频、语言等多种任务上均能带来效率与质量的提升。 更重要的是,当探索程度足够时,XM可以实现真正的端到端生成。在机器人控制等任务中,仅需一次网络前向传播的XM策略,其性能可媲美甚至超过需要上百次前向的扩散模型策略,实现了推理效率的飞跃。 尽管“最佳K样本选择”的思想并非全新,但该研究的贡献在于清晰地揭示了这一简单机制如何直接解决生成模型的核心瓶颈,并为实现高效、端到端的生成模型开辟了新的可能性。随着模型规模的持续扩大,探索这一新维度可能将发挥越来越关键的作用。

2012 年,AlexNet 用一场压倒性的胜利终结了一个时代。在此之前,做图像识别要靠人手工设计一层层特征提取的流程;AlexNet 证明了一件后来被反复验证的事:把整个任务端到端地交给模型自己学,几乎总是打得过人类精心设计的分阶段流水线。

从图像分类到目标检测再到图像分割,深度学习的每一次跃迁背后,都是同一句话:让它自己一口气学完。

只有一个领域始终是例外:生成模型。

今天最强、最能扩展的生成模型(无论是自回归还是扩散模型)都不是端到端的。

它们训练时只学预测「一小步」,推理时却要像循环网络那样把这一步反复展开几百上千次。

训练和推理用的不是同一套采样方式。这个裂缝带来了一个老问题:每一步的误差会喂进下一步,输入逐渐漂离训练时见过的分布,误差层层累积。学术上管它叫「暴露偏差」(exposure bias)

换句话说,「端到端更好」这条深度学习最核心的经验,十几年来始终没能真正落到生成模型头上。

而就在最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。

作者给这个新范式起了个名字,叫Explorative Modeling(探索式建模),模型简称XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴

项目网站:https://explorative-modeling.github.io

论文地址:https://arxiv.org/abs/2607.27372

代码仓库:https://github.com/alexiglad/XM

问题的根源:模型只会「取平均」

要理解这篇论文在解决什么,得先理解生成到底难在哪。

普通的监督学习(比如分类)每个输入基本只有一个正确答案,模型学一个确定的映射就够了。

但生成不一样。你让模型「生成一只狗」,正确答案甚至可能有无穷多个。这些合法的输出,就是数据分布里的一个个 mode(即分布中一个个独立的峰)。生成难,正是因为要同时抓住这么多 mode。

麻烦在于,主流生成模型训练时用的是重构损失(比如平方误差)。当一个输入被随机配上了许多个不同的合法目标,重构损失能给出的最优解,是这些目标的平均值。而对绝大多数数据来说,平均值根本不在数据流形上,而落在几个 mode 中间,谁也不像。

论文里那张图很直观:让模型在没有任何技巧的情况下直接端到端地回归,三堆散点会被它预测成正中间的一个点,一张狗的照片会糊成一团,一句话会退化成把「the」重复到底。这就是「mode 模糊」(mode blurring),即最优解恰恰是最不像真实数据的那个答案。

现有模型是怎么绕过去的?答案是把「生成」这件事拆碎。自回归一次只预测一个元素,扩散一次只去掉一点噪声,每一小步的目标都被切到几乎只剩单一 mode,于是重构损失就不会再去取平均。

这套「拆分生成过程」正是扩散和自回归能做出高质量样本的原因,但也正是它,让模型没法端到端。

作者由此提出了一个关键的追问:一个生成模型只有两样东西可以拆,一个是怎么生成,一个是怎么训练。

既然拆生成这条路会毁掉端到端,那为什么不去拆训练呢?

一个 for 循环:探索式建模的全部内核

Explorative Modeling 拆的就是训练循环本身。

它的机制可以用一句话说清:在每一个训练步,模型不再只生成一个样本去硬凑目标,而是生成 K 个候选,然后只挑其中离真实数据最近的那一个来训练、回传梯度。论文里把它实现成一个 3 到 5 行的 for 循环,简单到有点让人怀疑(Algorithm 1)。

为什么这么做就能解决 mode 模糊?

换个生活里的场景:猜飞镖落点。如果只让你猜一次,你的最优策略是猜所有飞镖的平均位置,可那往往是靶盘上根本没几支飞镖扎中的地方。但如果允许你猜 K 次、且只按最接近的那一次算分,最优策略立刻变了:你会把这几次猜测散开,让每一次去覆盖一簇不同的落点。

模型也是一样。当它被允许探索 K 个候选,不同的输入噪声就会各自「认领」一个不同的 mode,而不是全都挤到中间去取平均。探索多少次,模型就能稳稳抓住多少个 mode。

作者给这个被长期忽视的能力起了个名字:生成表达力(generative expressivity),并指出它由训练目标本身决定,无论你把参数和数据堆到多大,它都不会自己涨上去。

这也解释了一个业内早就观察到的怪现象:为什么今天最好的模型都那么依赖「引导」(guidance)技术。

所谓无分类器引导,本质是把预测「推离」那个模糊的平均值。但如果模型自己不糊,又何必去推它? 引导之所以有用,恰恰是 mode 模糊留下的病根。

论文还给出了ForwardReverse两种探索方向:前者固定一个真实目标、在自己的生成里搜最近的一个,偏向「查全」(覆盖所有 mode);后者固定一个生成、在真实数据里搜最近的一个,偏向「查准」,且几乎不增加算力开销,代价是可能塌缩到少数 mode。两者互补,可以组合使用。

第三根轴:越放大,收益越大

这篇论文最有分量的结论,是把「探索」验证成了一根真正的 scaling 轴

作者把探索加到扩散/流模型、Jumpy 模型乃至掩码扩散语言模型上,在图像、视频、语言三种模态上一致地看到性能单调提升。更关键的是收益随规模的走向:越放大越猛。

论文给出的数字是:随着数据规模增长,探索带来的增益从 7% 一路爬到 36%;随着模型增大,从 13% 爬到 23%;当算力翻到三倍时,效率增益直接翻了一倍多。

具体到效率上,探索把 FLOP 效率提升了 4.1 倍、样本效率提升了 6.2 倍、参数效率提升了 47%。在图像生成上,它把当前最强的 RAE 配方进一步推到了 ImageNet 上无引导 1.43 的 FID,逼近业界最好水平。

一个探索 5 个 mode 的 Large 模型,甚至能跑赢一个多了 47% 参数却不做探索的 XLarge 模型。

这个走向的含义并不小。作者的解释是:小规模时,模型主要被参数和数据卡着,生成表达力还不是瓶颈;可一旦参数和数据放大到「不再是限制」的地步,生成表达力就会越来越成为那个真正的瓶颈。而它正是探索能直接放大的东西。

考虑到当下真正的基础模型训练,用的算力比这篇论文最大的实验还高出约四个数量级,作者认为论文里报出的这些数字,很可能只是更大规模下收益的下限

真正端到端的生成

如果把探索推到极限,会发生什么?答案回到了开头那个悬念:生成模型终于可以端到端了

作者把 XM 当作独立的端到端模型,拿去做机器人控制任务。在行为克隆(Behavior Cloning)上,他们的 Explorative Policy 只用一次网络前向就追平甚至超过了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模上,Explorative World Model 用比 Diffuser 少 16 到 256 倍的推理算力,做到了更好的平均表现。

这个差距的来源很清晰:扩散模型是在推理时用几百步生成来换取表达力,而端到端的 XM 把这笔账挪到了训练时的探索上,推理因此只需一次前向。「处理多 mode」这同样一件事,要么在推理时慢慢拆,要么在训练时一次探索到位;这篇论文选择了后者。

作者介绍

这篇论文的第一作者Alexi Gladstone并不是生面孔。就在 2025 年 7 月,他主导的Energy-Based Transformers(EBT)曾在社交平台上引发过不小的讨论。

那项工作声称首次在多个维度上「跑赢」了标准前馈 Transformer 的扩展曲线,并试图把「System 2 思考」推广到任意 mode。参阅机器之心报道《新范式来了!新能量模型打破 Transformer++扩展上限,训练扩展率快 35%》。

Explorative Modeling 与他一贯的思路一脉相承:都在追问「模型能不能通过某种搜索、探索的方式,去做单次前向做不到的事」。而这篇论文更是建立在他与合作者(Yilun Du 和 Heng Ji)的另一套理论Mode Forcing之上。论文里坦言,正因为有那套理论在先,XM 的大部分结果是先被理论预测、再被实验验证的,这在以「跑完实验再解释」为常态的深度学习圈里,并不多见。

作者也很坦诚地承认了局限:best-of-K 这个想法本身并不新,前人做过很多次;他们真正的贡献,是想清楚了这个简单循环到底在做什么:它在不拆分生成过程的前提下,直接放大了生成表达力。

此外,自回归语言模型目前仍是最难啃的骨头,纯端到端的 Forward XM 在极度多 mode 的分布(比如图像生成)上还太贵,这些都留给了后续工作。

十几年来,我们习惯了用两个旋钮去调生成模型:把它做得更大,喂它更多数据。

这篇论文提出的第三个旋钮相当朴素:让模型多猜几次、只留最好的一次。但如果它揭示的趋势成立,那么随着规模继续膨胀,前两个旋钮迟早会拧到头,而第三个才刚刚开始转动。

参考链接

https://x.com/AlexiGlad/status/2083230922196107288

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:Panda

Trending Cryptos

Related Questions

Q什么是生成模型中的“暴露偏差”(exposure bias)?

A“暴露偏差”是生成模型训练与推理方式不一致导致的问题。主流生成模型训练时只学习预测一个“小步骤”(如自回归模型预测下一个token,扩散模型预测一步噪声),但在推理时需要将这个步骤循环展开数百上千次。由于推理时每一步的输入会逐步偏离训练时见过的分布,导致每一步的微小误差层层累积,最终影响生成样本的质量。

QExplorative Modeling (XM) 的核心方法是什么?

AExplorative Modeling (XM) 的核心是在训练过程中引入一个简单的for循环进行“探索”。具体来说,在每一个训练步,模型不再是生成单个样本来拟合目标,而是生成K个候选样本,然后只挑选其中与真实数据最接近的那个样本来计算损失并回传梯度。这种方法迫使模型在一次训练步骤中探索并覆盖多个可能的目标(或“模式”),从而解决了多模态数据分布下直接使用重构损失会导致“模式模糊”的问题。

Q论文中提到的“生成表达力”(generative expressivity)是什么?

A“生成表达力”是论文中提出的一个概念,指模型能够同时捕捉数据分布中多个不同“模式”的能力。传统使用重构损失的模型,当面对一个输入对应多个合法输出时,其最优解是输出这些目标的平均值,导致生成结果模糊、缺乏多样性。这种表达能力由训练目标本身决定,不能通过单纯增加模型参数或数据规模来提升。Explorative Modeling 通过训练时的探索,直接增强了模型的生成表达力。

QForward 和 Reverse 两种探索方向有什么区别?

AForward探索和Reverse探索是XM中两种互补的探索策略。Forward探索:固定一个真实数据目标,在模型生成的K个候选样本中,寻找与这个真实目标最接近的一个来训练。这种方法偏向于“查全”,旨在让生成尽可能覆盖数据分布中的所有模式,但计算成本较高。Reverse探索:固定模型生成的一个候选样本,在训练数据中寻找与其最接近的真实样本进行训练。这种方法偏向于“查准”,能确保生成的样本更接近真实数据中的某个模式,且计算成本几乎不增加,但可能导致模型塌缩到少数几个模式上。两者可以组合使用。

QExplorative Modeling 在实验中展现出怎样的扩展性收益?

A实验表明,“探索”本身可以成为继模型规模(参数)和数据规模之后,生成模型的第三根有效的扩展轴。随着模型规模、数据规模或计算预算的增加,使用探索带来的性能增益(如图像生成的FID指标提升)也单调递增。例如,当数据规模增长时,探索带来的增益从7%爬升到36%;当模型变大时,增益从13%爬到23%。一个探索5个模式的大型模型,其性能可以超越一个参数多47%但不做探索的超大型模型。这表明,在规模足够大时,生成表达力将成为关键瓶颈,而探索是直接解决这一瓶颈的有效手段。

Related Reads

Bitcoin Policy Institute Calls on AI Developers to Provide Crypto Infrastructure Defenders with Access to Advanced Models

The Bitcoin Policy Institute (BPI) has issued an open letter urging leading AI developers to grant trusted access to advanced AI models for defenders of critical crypto infrastructure. Analysts warn that sophisticated AI systems, capable of analyzing large codebases and finding vulnerabilities, could be leveraged by malicious actors before open-source defenders can use them, posing a significant risk to the trillion-dollar digital asset ecosystem. Vulnerable points include wallets, signing devices, cryptographic libraries, node software, exchanges, and payment networks. BPI highlights that developers of key open-source projects like Bitcoin Core currently lack access to the specialized cybersecurity programs and most powerful AI models available to leading AI labs and their partners. This creates a dangerous asymmetry. The institute calls on AI labs to establish or expand permanent trusted access programs, providing qualified developers and researchers with early, supervised access to cutting-edge models, sufficient computing resources for security audits, secure environments for analyzing sensitive code, and direct channels for vulnerability disclosure and coordinated fixes. The goal is to enable defenders to identify and patch security flaws before attackers can exploit them. BPI also urges the crypto industry to assist AI labs in identifying reliable participants for such access programs and coordinating response efforts.

cryptonews.ru6m ago

Bitcoin Policy Institute Calls on AI Developers to Provide Crypto Infrastructure Defenders with Access to Advanced Models

cryptonews.ru6m ago

Ethena's USDe Captures 43% of Stablecoin Supply on Robinhood Chain for Capital Placement

USDe from Ethena has rapidly become the primary source of dollar liquidity on the Robinhood Chain, surging from about $17 million a month ago to roughly $253 million, accounting for nearly 43% of the network's total stablecoin volume. This synthetic dollar, which maintains its value through crypto assets and offsetting derivatives positions, indicates that incoming capital is seeking more than just a trading venue. It reflects a broader shift where crypto investors are using stablecoins for DeFi, collateral, and yield strategies. Robinhood Chain, an Ethereum L2, is seeing its dollar base shift towards yield-bearing assets. Unlike traditional stablecoins like Paxos's USDG, USDe is a synthetic dollar that does not inherently pay yield; users must stake it to earn rewards via sUSDe within Ethena's delta-neutral framework. Analysts view the rapid inflow as capital being deposited within the network, not just transiting through it, potentially boosting lending and trading activities even without user growth. While transaction activity has spiked—averaging about 11.6 million daily transactions, up 30% weekly—daily active accounts have grown only modestly and remain below July peaks. Currently, memecoins like $CASHCAT dominate over 99% of trading volume, driving speculation rather than the platform's long-term focus on tokenized securities. The key challenge for Robinhood will be converting this initial speculative activity into sustainable, long-term financial transactions aligned with its tokenization strategy.

cryptonews.ru9m ago

Ethena's USDe Captures 43% of Stablecoin Supply on Robinhood Chain for Capital Placement

cryptonews.ru9m ago

Trading

Spot

Hot Articles

How to Buy CORE

Welcome to HTX.com! We've made purchasing CORE (CORE) simple and convenient. Follow our step-by-step guide to embark on your crypto journey.Step 1: Create Your HTX AccountUse your email or phone number to sign up for a free account on HTX. Experience a hassle-free registration journey and unlock all features.Get My AccountStep 2: Go to Buy Crypto and Choose Your Payment MethodCredit/Debit Card: Use your Visa or Mastercard to buy CORE (CORE) instantly.Balance: Use funds from your HTX account balance to trade seamlessly.Third Parties: We've added popular payment methods such as Google Pay and Apple Pay to enhance convenience.P2P: Trade directly with other users on HTX.Over-the-Counter (OTC): We offer tailor-made services and competitive exchange rates for traders.Step 3: Store Your CORE (CORE)After purchasing your CORE (CORE), store it in your HTX account. Alternatively, you can send it elsewhere via blockchain transfer or use it to trade other cryptocurrencies.Step 4: Trade CORE (CORE)Easily trade CORE (CORE) on HTX's spot market. Simply access your account, select your trading pair, execute your trades, and monitor in real-time. We offer a user-friendly experience for both beginners and seasoned traders.

6.1k Total ViewsPublished 2024.03.29Updated 2026.06.02

How to Buy CORE

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of CORE (CORE) are presented below.

活动图片