生成模型也能端到端训练了?核心竟是一个for循环

marsbitОпубликовано 2026-08-03Обновлено 2026-08-03

Введение

长期以来,深度学习在图像分类、检测等任务上凭借端到端训练取得了巨大成功,但生成模型领域却始终是个例外。当前主流的自回归、扩散模型等训练时只学习预测“一小步”,推理时则需要反复展开数百上千步,这种训练与推理的不一致导致了“暴露偏差”等问题,使得生成模型一直未能实现真正的端到端训练。 最近,一篇来自UIUC与哈佛大学的论文提出了“探索式建模(Explorative Modeling,XM)”新范式,其核心是一个简单到近乎朴素的for循环:在每个训练步骤中,模型生成K个候选样本,然后仅选取其中最接近真实数据的一个样本来计算损失和回传梯度。这种做法巧妙地绕开了传统生成模型中因使用重构损失(如平方误差)而导致的“模态模糊”问题——即模型倾向于输出多个可能答案的平均值,而这个平均值往往不属于任何真实的数据模式。 XM通过这种方式,在不拆分生成过程的前提下,直接提升了模型的“生成表达力”,即模型捕捉数据分布中多个独立模式的能力。论文将“探索”验证为继模型参数量、数据量之后的第三根可扩展轴。实验表明,随着模型规模、数据量和计算量的增大,探索带来的性能收益越发显著,在图像、视频、语言等多种任务上均能带来效率与质量的提升。 更重要的是,当探索程度足够时,XM可以实现真正的端到端生成。在机器人控制等任务中,仅需一次网络前向传播的XM策略,其性能可媲美甚至超过需要上百次前向的扩散模型策略,实现了推理效率的飞跃。 尽管“最佳K样本选择”的思想并非全新,但该研究的贡献在于清晰地揭示了这一简单机制如何直接解决生成模型的核心瓶颈,并为实现高效、端到端的生成模型开辟了新的可能性。随着模型规模的持续扩大,探索这一新维度可能将发挥越来越关键的作用。

2012 年,AlexNet 用一场压倒性的胜利终结了一个时代。在此之前,做图像识别要靠人手工设计一层层特征提取的流程;AlexNet 证明了一件后来被反复验证的事:把整个任务端到端地交给模型自己学,几乎总是打得过人类精心设计的分阶段流水线。

从图像分类到目标检测再到图像分割,深度学习的每一次跃迁背后,都是同一句话:让它自己一口气学完。

只有一个领域始终是例外:生成模型。

今天最强、最能扩展的生成模型(无论是自回归还是扩散模型)都不是端到端的。

它们训练时只学预测「一小步」,推理时却要像循环网络那样把这一步反复展开几百上千次。

训练和推理用的不是同一套采样方式。这个裂缝带来了一个老问题:每一步的误差会喂进下一步,输入逐渐漂离训练时见过的分布,误差层层累积。学术上管它叫「暴露偏差」(exposure bias)

换句话说,「端到端更好」这条深度学习最核心的经验,十几年来始终没能真正落到生成模型头上。

而就在最近,一篇来自 UIUC 与哈佛大学的论文,试图把这块最后的拼图补上。

作者给这个新范式起了个名字,叫Explorative Modeling(探索式建模),模型简称XM。它的想法简单到近乎朴素,却指向一个大胆的结论:生成模型除了参数和数据,其实还有第三根可以放大的轴

项目网站:https://explorative-modeling.github.io

论文地址:https://arxiv.org/abs/2607.27372

代码仓库:https://github.com/alexiglad/XM

问题的根源:模型只会「取平均」

要理解这篇论文在解决什么,得先理解生成到底难在哪。

普通的监督学习(比如分类)每个输入基本只有一个正确答案,模型学一个确定的映射就够了。

但生成不一样。你让模型「生成一只狗」,正确答案甚至可能有无穷多个。这些合法的输出,就是数据分布里的一个个 mode(即分布中一个个独立的峰)。生成难,正是因为要同时抓住这么多 mode。

麻烦在于,主流生成模型训练时用的是重构损失(比如平方误差)。当一个输入被随机配上了许多个不同的合法目标,重构损失能给出的最优解,是这些目标的平均值。而对绝大多数数据来说,平均值根本不在数据流形上,而落在几个 mode 中间,谁也不像。

论文里那张图很直观:让模型在没有任何技巧的情况下直接端到端地回归,三堆散点会被它预测成正中间的一个点,一张狗的照片会糊成一团,一句话会退化成把「the」重复到底。这就是「mode 模糊」(mode blurring),即最优解恰恰是最不像真实数据的那个答案。

现有模型是怎么绕过去的?答案是把「生成」这件事拆碎。自回归一次只预测一个元素,扩散一次只去掉一点噪声,每一小步的目标都被切到几乎只剩单一 mode,于是重构损失就不会再去取平均。

这套「拆分生成过程」正是扩散和自回归能做出高质量样本的原因,但也正是它,让模型没法端到端。

作者由此提出了一个关键的追问:一个生成模型只有两样东西可以拆,一个是怎么生成,一个是怎么训练。

既然拆生成这条路会毁掉端到端,那为什么不去拆训练呢?

一个 for 循环:探索式建模的全部内核

Explorative Modeling 拆的就是训练循环本身。

它的机制可以用一句话说清:在每一个训练步,模型不再只生成一个样本去硬凑目标,而是生成 K 个候选,然后只挑其中离真实数据最近的那一个来训练、回传梯度。论文里把它实现成一个 3 到 5 行的 for 循环,简单到有点让人怀疑(Algorithm 1)。

为什么这么做就能解决 mode 模糊?

换个生活里的场景:猜飞镖落点。如果只让你猜一次,你的最优策略是猜所有飞镖的平均位置,可那往往是靶盘上根本没几支飞镖扎中的地方。但如果允许你猜 K 次、且只按最接近的那一次算分,最优策略立刻变了:你会把这几次猜测散开,让每一次去覆盖一簇不同的落点。

模型也是一样。当它被允许探索 K 个候选,不同的输入噪声就会各自「认领」一个不同的 mode,而不是全都挤到中间去取平均。探索多少次,模型就能稳稳抓住多少个 mode。

作者给这个被长期忽视的能力起了个名字:生成表达力(generative expressivity),并指出它由训练目标本身决定,无论你把参数和数据堆到多大,它都不会自己涨上去。

这也解释了一个业内早就观察到的怪现象:为什么今天最好的模型都那么依赖「引导」(guidance)技术。

所谓无分类器引导,本质是把预测「推离」那个模糊的平均值。但如果模型自己不糊,又何必去推它? 引导之所以有用,恰恰是 mode 模糊留下的病根。

论文还给出了ForwardReverse两种探索方向:前者固定一个真实目标、在自己的生成里搜最近的一个,偏向「查全」(覆盖所有 mode);后者固定一个生成、在真实数据里搜最近的一个,偏向「查准」,且几乎不增加算力开销,代价是可能塌缩到少数 mode。两者互补,可以组合使用。

第三根轴:越放大,收益越大

这篇论文最有分量的结论,是把「探索」验证成了一根真正的 scaling 轴

作者把探索加到扩散/流模型、Jumpy 模型乃至掩码扩散语言模型上,在图像、视频、语言三种模态上一致地看到性能单调提升。更关键的是收益随规模的走向:越放大越猛。

论文给出的数字是:随着数据规模增长,探索带来的增益从 7% 一路爬到 36%;随着模型增大,从 13% 爬到 23%;当算力翻到三倍时,效率增益直接翻了一倍多。

具体到效率上,探索把 FLOP 效率提升了 4.1 倍、样本效率提升了 6.2 倍、参数效率提升了 47%。在图像生成上,它把当前最强的 RAE 配方进一步推到了 ImageNet 上无引导 1.43 的 FID,逼近业界最好水平。

一个探索 5 个 mode 的 Large 模型,甚至能跑赢一个多了 47% 参数却不做探索的 XLarge 模型。

这个走向的含义并不小。作者的解释是:小规模时,模型主要被参数和数据卡着,生成表达力还不是瓶颈;可一旦参数和数据放大到「不再是限制」的地步,生成表达力就会越来越成为那个真正的瓶颈。而它正是探索能直接放大的东西。

考虑到当下真正的基础模型训练,用的算力比这篇论文最大的实验还高出约四个数量级,作者认为论文里报出的这些数字,很可能只是更大规模下收益的下限

真正端到端的生成

如果把探索推到极限,会发生什么?答案回到了开头那个悬念:生成模型终于可以端到端了

作者把 XM 当作独立的端到端模型,拿去做机器人控制任务。在行为克隆(Behavior Cloning)上,他们的 Explorative Policy 只用一次网络前向就追平甚至超过了需要 100 次前向的 Diffusion Policy;在目标导向的世界建模上,Explorative World Model 用比 Diffuser 少 16 到 256 倍的推理算力,做到了更好的平均表现。

这个差距的来源很清晰:扩散模型是在推理时用几百步生成来换取表达力,而端到端的 XM 把这笔账挪到了训练时的探索上,推理因此只需一次前向。「处理多 mode」这同样一件事,要么在推理时慢慢拆,要么在训练时一次探索到位;这篇论文选择了后者。

作者介绍

这篇论文的第一作者Alexi Gladstone并不是生面孔。就在 2025 年 7 月,他主导的Energy-Based Transformers(EBT)曾在社交平台上引发过不小的讨论。

那项工作声称首次在多个维度上「跑赢」了标准前馈 Transformer 的扩展曲线,并试图把「System 2 思考」推广到任意 mode。参阅机器之心报道《新范式来了!新能量模型打破 Transformer++扩展上限,训练扩展率快 35%》。

Explorative Modeling 与他一贯的思路一脉相承:都在追问「模型能不能通过某种搜索、探索的方式,去做单次前向做不到的事」。而这篇论文更是建立在他与合作者(Yilun Du 和 Heng Ji)的另一套理论Mode Forcing之上。论文里坦言,正因为有那套理论在先,XM 的大部分结果是先被理论预测、再被实验验证的,这在以「跑完实验再解释」为常态的深度学习圈里,并不多见。

作者也很坦诚地承认了局限:best-of-K 这个想法本身并不新,前人做过很多次;他们真正的贡献,是想清楚了这个简单循环到底在做什么:它在不拆分生成过程的前提下,直接放大了生成表达力。

此外,自回归语言模型目前仍是最难啃的骨头,纯端到端的 Forward XM 在极度多 mode 的分布(比如图像生成)上还太贵,这些都留给了后续工作。

十几年来,我们习惯了用两个旋钮去调生成模型:把它做得更大,喂它更多数据。

这篇论文提出的第三个旋钮相当朴素:让模型多猜几次、只留最好的一次。但如果它揭示的趋势成立,那么随着规模继续膨胀,前两个旋钮迟早会拧到头,而第三个才刚刚开始转动。

参考链接

https://x.com/AlexiGlad/status/2083230922196107288

本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:Panda

Трендовые криптовалюты

Связанные с этим вопросы

Q什么是生成模型中的“暴露偏差”(exposure bias)?

A“暴露偏差”是生成模型训练与推理方式不一致导致的问题。主流生成模型训练时只学习预测一个“小步骤”(如自回归模型预测下一个token,扩散模型预测一步噪声),但在推理时需要将这个步骤循环展开数百上千次。由于推理时每一步的输入会逐步偏离训练时见过的分布,导致每一步的微小误差层层累积,最终影响生成样本的质量。

QExplorative Modeling (XM) 的核心方法是什么?

AExplorative Modeling (XM) 的核心是在训练过程中引入一个简单的for循环进行“探索”。具体来说,在每一个训练步,模型不再是生成单个样本来拟合目标,而是生成K个候选样本,然后只挑选其中与真实数据最接近的那个样本来计算损失并回传梯度。这种方法迫使模型在一次训练步骤中探索并覆盖多个可能的目标(或“模式”),从而解决了多模态数据分布下直接使用重构损失会导致“模式模糊”的问题。

Q论文中提到的“生成表达力”(generative expressivity)是什么?

A“生成表达力”是论文中提出的一个概念,指模型能够同时捕捉数据分布中多个不同“模式”的能力。传统使用重构损失的模型,当面对一个输入对应多个合法输出时,其最优解是输出这些目标的平均值,导致生成结果模糊、缺乏多样性。这种表达能力由训练目标本身决定,不能通过单纯增加模型参数或数据规模来提升。Explorative Modeling 通过训练时的探索,直接增强了模型的生成表达力。

QForward 和 Reverse 两种探索方向有什么区别?

AForward探索和Reverse探索是XM中两种互补的探索策略。Forward探索:固定一个真实数据目标,在模型生成的K个候选样本中,寻找与这个真实目标最接近的一个来训练。这种方法偏向于“查全”,旨在让生成尽可能覆盖数据分布中的所有模式,但计算成本较高。Reverse探索:固定模型生成的一个候选样本,在训练数据中寻找与其最接近的真实样本进行训练。这种方法偏向于“查准”,能确保生成的样本更接近真实数据中的某个模式,且计算成本几乎不增加,但可能导致模型塌缩到少数几个模式上。两者可以组合使用。

QExplorative Modeling 在实验中展现出怎样的扩展性收益?

A实验表明,“探索”本身可以成为继模型规模(参数)和数据规模之后,生成模型的第三根有效的扩展轴。随着模型规模、数据规模或计算预算的增加,使用探索带来的性能增益(如图像生成的FID指标提升)也单调递增。例如,当数据规模增长时,探索带来的增益从7%爬升到36%;当模型变大时,增益从13%爬到23%。一个探索5个模式的大型模型,其性能可以超越一个参数多47%但不做探索的超大型模型。这表明,在规模足够大时,生成表达力将成为关键瓶颈,而探索是直接解决这一瓶颈的有效手段。

Похожее

Bitcoin Policy Institute призвал разработчиков ИИ предоставить защитникам криптоинфраструктуры доступ к передовым моделям

Институт биткоин-политики (BPI) предупреждает о рисках, которые передовые системы искусственного интеллекта (ИИ) представляют для безопасности криптоинфраструктуры. В открытом письме к разработчикам ИИ аналитики отмечают, что современные модели уже способны анализировать код, находить уязвимости и выполнять сложную техническую работу, и эти возможности могут быстрее попасть в руки злоумышленников, чем защитников открытого ПО. Под угрозой находятся кошельки, криптографические библиотеки, ПО узлов, биржи и платежные сети, причем атаки на цифровые активы могут приводить к быстрым финансовым потерям. BPI подчеркивает, что разработчики критически важного открытого ПО, такие как команда Bitcoin Core, не имеют доступа к самым мощным ИИ-моделям и специализированным инструментам кибербезопасности, которые доступны ведущим лабораториям и их партнерам. Чтобы снизить риски, Институт призывает ИИ-лаборатории создать программы доверенного доступа для квалифицированных разработчиков, защищающих открытую финансовую инфраструктуру. Предложения включают ранний доступ к мощным моделям, выделение вычислительных ресурсов для длительных проверок безопасности, защищенные среды для анализа кода, а также доступ для небольших команд и независимых исследователей. Цель — позволить защитникам находить и устранять уязвимости до того, как ими воспользуются злоумышленники. BPI также призывает криптоиндустрию помочь в определении надежных участников таких программ и координации реагирования на угрозы.

cryptonews.ru5 мин. назад

Bitcoin Policy Institute призвал разработчиков ИИ предоставить защитникам криптоинфраструктуры доступ к передовым моделям

cryptonews.ru5 мин. назад

Bitwise сократила 14% персонала на фоне спада крипторынка

Компания Bitwise Asset Management объявила о сокращении 14% персонала, или около 25 сотрудников, в связи со спадом на крипторынке. Численность штата снизилась со 180 до 155 человек, но конкретные затронутые подразделения не были названы. Генеральный директор Хантер Хорсли заявил, что данные меры подготовки компании к будущему росту рынка, который, по его мнению, будет обусловлен более глубокой интеграцией криптоактивов в мировую экономику. Bitwise является крупным провайдером биржевых продуктов, управляющим активами на сумму около $9 млрд, включая спотовый биткоин-ETF BITB с капиталом $2,3 млрд. Сокращения в Bitwise отражают общий тренд на консолидацию и оптимизацию расходов в криптоиндустрии, который также затронул и других крупных игроков, таких как Hashdex и Grayscale Investments.

cryptonews.ru5 мин. назад

Bitwise сократила 14% персонала на фоне спада крипторынка

cryptonews.ru5 мин. назад

Хакер вывел $200 000 из кроссчейн-моста XRP

Команда проекта tx раскрыла детали атаки на кроссчейн-мост, соединяющий XRP Ledger с их блокчейном. 9 августа злоумышленник, воспользовавшись уязвимостью в логике обработки депозитов, вывел из резервного кошелька моста около 200 000 XRP (приблизительно $199 916). Инцидент произошел из-за того, что система некорректно принимала определенные транзакции и выпускала на их основе «обернутые» токены в сети tx, которые затем использовались для вывода реальных средств. Мост был остановлен, уязвимость устранена. Средства пользователей в мейннете и на биржах не пострадали. Команда привлекла экспертов и передала данные в ФБР, рассматривая варианты компенсации. Параллельно атаке подвергся блокчейн Harmony. Злоумышленник, используя пустые блоки, создал 4 млрд токенов ONE (26% от общего предложения) и вывел из них 2.8 млрд на биржи, что привело к обвалу цены монеты почти на 30%. Команда Harmony работает над заморозкой средств и рассматривает возможность отката сети. Ранее, в июне 2022 года, проект уже терял $100 млн в результате взлома, который, по данным аналитиков, был связан с хакерами из Северной Кореи.

cryptonews.ru7 мин. назад

Хакер вывел $200 000 из кроссчейн-моста XRP

cryptonews.ru7 мин. назад

USDe от Ethena забирает 43% стейблкоинов Robinhood Chain для размещения капитала

Стейблкоин USDe от Ethena стремительно занял доминирующую позицию в качестве источника долларовой ликвидности в сети Robinhood Chain, увеличив свой объем с примерно $17 млн до $253 млн за месяц. На его долю теперь приходится почти 43% от общего объема стейблкоинов в сети. USDe — это синтетический доллар, обеспеченный криптоактивами и хеджируемый деривативами, что отличает его от традиционных стейблкоинов. Его рост сигнализирует о сдвиге в использовании стейблкоинов: от простого средства обмена к инструменту для DeFi, залога и стратегий получения дохода. В то время как общий объем заблокированных средств (TVL) и количество транзакций в сети Robinhood Chain значительно выросли, число ежедневно активных пользователей осталось практически неизменным. Это указывает на то, что рост обусловлен в первую очередь притоком капитала, а не расширением пользовательской базы. Основным драйвером активности в сети в настоящее время являются мемкоины (в частности, токен $CASHCAT), на которые приходится свыше 99% торгового объема, в то время как долгосрочная стратегия Robinhood Chain связана с токенизацией реальных активов. Ключевой задачей для платформы станет преобразование текущей спекулятивной активности в устойчивые финансовые операции.

cryptonews.ru8 мин. назад

USDe от Ethena забирает 43% стейблкоинов Robinhood Chain для размещения капитала

cryptonews.ru8 мин. назад

Соучредитель Sui разрабатывает аппаратные кошельки, защищенные от квантовых атак, по цене 10 долларов

Соучредитель Mysten Labs (компании-разработчике блокчейна Sui) Костас Халкиас объявил о работе над массовым производством квантово-безопасных аппаратных кошельков стоимостью менее 10 долларов. Цель проекта — создание доступных карт для двухфакторной аутентификации (2FA) с временем формирования квантовой подписи 1–2 секунды через NFC. Халкиас отметил, что занимается этим в свободное время и готов спонсировать карты для нуждающихся пользователей. Инициатива стала ответом на недавний инцидент с аппаратным кошельком Coldcard, где уязвимость в прошивке привела к потере средств на сумму около 130 млн долларов. Хотя атака на Coldcard не была квантовой, она высветила риски криптографических сбоев в аппаратных кошельках. Проект основывается на дорожной карте Sui по внедрению квантовой безопасности на уровне протокола. Планируется добавить две схемы подписи, одобренные NIST, для повседневных счетов и хранилищ с высокой стоимостью. Существующие пользователи смогут перейти на квантово-безопасные ключи, используя текущие фразы восстановления, без полной миграции. Это структурное преимущество Sui позволяет внедрять новые методы аутентификации без радикальных хард-форков.

cryptonews.ru9 мин. назад

Соучредитель Sui разрабатывает аппаратные кошельки, защищенные от квантовых атак, по цене 10 долларов

cryptonews.ru9 мин. назад

Торговля

Спот

Популярные статьи

Как купить CORE

Добро пожаловать на HTX.com! Мы сделали приобретение CORE (CORE) простым и удобным. Следуйте нашему пошаговому руководству и отправляйтесь в свое крипто-путешествие.Шаг 1: Создайте аккаунт на HTXИспользуйте свой адрес электронной почты или номер телефона, чтобы зарегистрироваться и бесплатно создать аккаунт на HTX. Пройдите удобную регистрацию и откройте для себя весь функционал.Создать аккаунтШаг 2: Перейдите в Купить криптовалюту и выберите свой способ оплатыКредитная/Дебетовая Карта: Используйте свою карту Visa или Mastercard для мгновенной покупки CORE (CORE).Баланс: Используйте средства с баланса вашего аккаунта HTX для простой торговли.Третьи Лица: Мы добавили популярные способы оплаты, такие как Google Pay и Apple Pay, для повышения удобства.P2P: Торгуйте напрямую с другими пользователями на HTX.Внебиржевая Торговля (OTC): Мы предлагаем индивидуальные услуги и конкурентоспособные обменные курсы для трейдеров.Шаг 3: Хранение CORE (CORE)После приобретения вами CORE (CORE) храните их в своем аккаунте на HTX. В качестве альтернативы вы можете отправить их куда-либо с помощью перевода в блокчейне или использовать для торговли с другими криптовалютами.Шаг 4: Торговля CORE (CORE)С легкостью торгуйте CORE (CORE) на спотовом рынке HTX. Просто зайдите в свой аккаунт, выберите торговую пару, совершайте сделки и следите за ними в режиме реального времени. Мы предлагаем удобный интерфейс как для начинающих, так и для опытных трейдеров.

750 просмотров всегоОпубликовано 2024.03.29Обновлено 2026.06.02

Как купить CORE

Обсуждения

Добро пожаловать в Сообщество HTX. Здесь вы сможете быть в курсе последних новостей о развитии платформы и получить доступ к профессиональной аналитической информации о рынке. Мнения пользователей о цене на CORE (CORE) представлены ниже.

活动图片