В 2012 году AlexNet своей сокрушительной победой завершил целую эпоху. До этого для распознавания изображений приходилось вручную проектировать многоуровневый конвейер извлечения признаков; AlexNet доказал то, что позже подтверждалось снова и снова: end-to-end обучение модели справляется с задачей почти всегда лучше, чем тщательно спроектированный человеком поэтапный пайплайн.
От классификации изображений до детекции объектов и сегментации — за каждым скачком в глубоком обучении стоит одна и та же идея: пусть модель учится всему за один подход.
Только одна область всегда оставалась исключением: генеративные модели.
Самые мощные и масштабируемые генеративные модели сегодня (будь то авторегрессионные или диффузионные) не являются end-to-end.
При обучении они учатся предсказывать только «небольшой шаг», но во время вывода этот шаг приходится разворачивать сотни и тысячи раз, как в рекуррентных сетях.
Обучение и вывод используют разные режимы выборки. Эта трещина порождает старую проблему: ошибка на каждом шаге подаётся на следующий, входные данные постепенно отклоняются от распределения, наблюдаемого при обучении, и ошибки накапливаются. В академических кругах это называется «смещением из-за экспозиции» (exposure bias).
Другими словами, ключевой принцип глубокого обучения — «end-to-end лучше» — за более чем десять лет так и не был по-настоящему применён к генеративным моделям.
И вот недавно статья исследователей из UIUC и Гарвардского университета попыталась добавить этот последний элемент пазла.

Авторы назвали эту новую парадигму Explorative Modeling (Исследовательское моделирование), а саму модель — XM. Её идея проста почти до наивности, но указывает на смелый вывод: У генеративных моделей, помимо параметров и данных, есть и третья ось, которую можно увеличивать.

Сайт проекта: https://explorative-modeling.github.io
Адрес статьи: https://arxiv.org/abs/2607.27372
Репозиторий кода: https://github.com/alexiglad/XM
Корень проблемы: модель умеет только «усреднять»
Чтобы понять, что решает эта статья, нужно сначала понять, в чём сложность генерации.
При обычном обучении с учителем (например, классификации) для каждого входа есть, как правило, один верный ответ, и модель изучает одно детерминированное отображение.
Но с генерацией всё иначе. Если вы попросите модель «сгенерировать собаку», верных ответов может быть даже бесконечно много. Эти допустимые выходные данные — это отдельные моды (пики) в распределении данных. Генерация сложна именно потому, что нужно одновременно охватить все эти моды.
Проблема в том, что основные генеративные модели при обучении используют реконструкционные потери (например, среднеквадратичную ошибку). Когда одному входу случайно сопоставляется множество разных допустимых целей, оптимальным решением для реконструкционных потерь является усреднение этих целей. А для подавляющего большинства данных среднее значение вовсе не лежит на многообразии данных, а находится между несколькими модами, не похоже ни на одну из них.
График в статье наглядно показывает: если заставить модель напрямую, без каких-либо ухищрений, регрессировать end-to-end, три облака точек будут предсказаны как одна точка посередине, фотография собаки превратится в размытое пятно, а предложение выродится в повторение слова «the». Это и есть «размытие мод» (mode blurring), когда оптимальное решение — именно тот ответ, который меньше всего похож на реальные данные.

Как существующие модели обходят эту проблему? Ответ: разбивая процесс «генерации». Авторегрессионные модели предсказывают по одному элементу за раз, диффузионные — убирают понемногу шума, цель каждого маленького шага сводится практически к одной моде, поэтому реконструкционные потери не пытаются усреднять.
Этот подход «разбиения процесса генерации» — именно то, что позволяет диффузионным и авторегрессионным моделям создавать высококачественные сэмплы, но именно он и не позволяет моделям быть end-to-end.
Авторы задаются ключевым вопросом: у генеративной модели есть только две вещи, которые можно разбить: сам процесс генерации и процесс обучения.
Раз разбиение генерации разрушает end-to-end подход, то почему бы не разбить обучение?

Один цикл for: вся суть исследовательского моделирования
Explorative Modeling разбивает именно цикл обучения.
Его механизм можно описать одной фразой: на каждом шаге обучения модель генерирует не один сэмпл, чтобы вписаться в цель, а K кандидатов, и затем для обучения и передачи градиента выбирается только тот, который ближе всего к реальным данным. В статье это реализовано в виде цикла for из 3–5 строк, настолько простого, что это вызывает сомнения (Algorithm 1).

Почему это решает проблему размытия мод?
Проведём аналогию из жизни: угадывание места падения дротика. Если можно угадать только один раз, оптимальная стратегия — угадать среднюю точку всех бросков, но это часто место, куда почти не попадают дротики. Однако если позволить угадать K раз и учитывать только самый близкий результат, оптимальная стратегия мгновенно меняется: вы будете распределять свои догадки, чтобы каждая покрывала отдельное скопление точек падения.

То же самое и с моделью. Когда ей позволено исследовать K кандидатов, разные входные шумы будут «привязываться» к разным модам, а не все стекаться к середине для усреднения. Сколько раз исследуешь, столько мод модель и сможет уверенно охватить.

Авторы дали этой долго игнорируемой способности имя: генеративная выразительность (generative expressivity), и указали, что она определяется самой целью обучения и не увеличивается сама по себе, сколько бы вы ни наращивали параметры и данные.

Это также объясняет давно наблюдаемый в отрасли парадокс: почему сегодняшние лучшие модели так зависят от техник «направления» (guidance).
Бесклассовое направление по сути «отталкивает» предсказание от размытого среднего. Но если бы модель сама не размывала, зачем её отталкивать? То, что направление полезно, как раз и есть следствие корневой проблемы размытия мод.
В статье также представлены два направления исследования: Forward и Reverse. Первое фиксирует реальную цель и ищет ближайший кандидат среди своих генераций, смещаясь в сторону «полноты охвата» (охват всех мод). Второе фиксирует сгенерированный сэмпл и ищет ближайший в реальных данных, смещаясь в сторону «точности», при этом почти не увеличивая вычислительные затраты, но рискуя коллапсировать до нескольких мод. Они дополняют друг друга и могут использоваться вместе.


Третья ось: чем больше масштаб, тем больше выгода
Самый весомый вывод этой статьи заключается в том, что «исследование» подтверждено как настоящая ось масштабирования.
Авторы добавили исследование к диффузионным/потоковым моделям, модели Jumpy и даже к маскированным диффузионным языковым моделям, и наблюдали монотонный рост производительности во всех трёх модальностях — изображениях, видео и языке. Что ещё важнее — характер роста выгоды с увеличением масштаба: чем больше, тем заметнее.
Цифры из статьи: с ростом объёма данных выгода от исследования выросла с 7% до 36%; с увеличением модели — с 13% до 23%; когда вычислительные ресурсы утроились, прирост эффективности более чем удвоился.
Что касается эффективности, исследование повысило FLOP-эффективность в 4.1 раза, эффективность использования сэмплов — в 6.2 раза, параметрическую эффективность — на 47%. В генерации изображений оно подняло текущий лучший рецепт RAE до FID 1.43 на ImageNet без направляющих, приблизившись к лучшим отраслевым показателям.

Большая модель, исследующая 5 мод, даже смогла превзойти XLarge-модель с на 47% большим числом параметров, но без исследования.

Этот тренд имеет немаловажное значение. Объяснение авторов: в малых масштабах модель в основном ограничена параметрами и данными, генеративная выразительность ещё не является узким местом; но как только параметры и данные увеличиваются до состояния «больше не ограничение», генеративная выразительность становится всё более реальным узким местом. А это именно то, что исследование может напрямую усилить.
Учитывая, что реальное обучение базовых моделей сегодня использует вычислительные ресурсы примерно на четыре порядка больше, чем в самых крупных экспериментах этой статьи, авторы считают, что приведённые в статье цифры, вероятно, представляют собой лишь нижнюю границу выгоды на ещё больших масштабах.
По-настоящему end-to-end генерация
Что произойдёт, если довести исследование до предела? Ответ возвращает нас к начальной интриге: генеративные модели наконец-то могут быть end-to-end.
Авторы использовали XM как независимую end-to-end модель для задач управления роботами. В клонировании поведения (Behavior Cloning) их Explorative Policy с одним прямым проходом сети догнала и даже превзошла Diffusion Policy, требующую 100 прямых проходов; в целеориентированном моделировании мира Explorative World Model с вычислительными затратами на вывод в 16–256 раз меньше, чем у Diffuser, показала лучшие средние результаты.


Источник этого разрыва ясен: диффузионные модели во время вывода тратят сотни шагов генерации, чтобы получить выразительность, в то время как end-to-end XM переносит эту «оплату» на исследование во время обучения, поэтому вывод требует всего одного прямого прохода. Одна и та же задача — «обработка множества мод» — либо медленно разбивается во время вывода, либо решается за один исследовательский подход во время обучения; эта статья выбирает последнее.
Об авторах
Первый автор статьи, Алекси Глэдстоун (Alexi Gladstone), уже знаком. Ещё в июле 2025 года его работа над Energy-Based Transformers (EBT) вызвала немалые дискуссии в социальных сетях.

Та работа заявляла о первом «превосходстве» над кривой масштабирования стандартного Transformer с прямой связью по нескольким измерениям и пыталась распространить «System 2 мышление» на произвольные моды. Подробнее в репортаже Machine Heart «Новая парадигма! Новая энергетическая модель преодолевает верхний предел масштабирования Transformer++, скорость обучения на 35% выше».

Explorative Modeling продолжает его последовательную линию мышления: вопрос о том, «может ли модель с помощью какого-либо поиска, исследования делать то, что не под силу одному прямому проходу». И эта статья основана на другой его совместной с соавторами (Илунь Ду (Yilun Du) и Хэн Цзи (Heng Ji)) теории под названием Mode Forcing. В статье прямо признаётся, что именно благодаря этой предшествующей теории большая часть результатов XM была сначала предсказана теоретически, а затем подтверждена экспериментально, что нечасто встречается в мире глубокого обучения, где нормой является «сначала эксперимент, потом объяснение».

Авторы также честно признают ограничения: сама идея best-of-K не нова, её пробовали много раз; их настоящий вклад в том, что они разобрались, что на самом деле делает этот простой цикл: он напрямую усиливает генеративную выразительность, не разбивая процесс генерации.
Кроме того, авторегрессионные языковые модели по-прежнему остаются самой сложной задачей, чисто end-to-end Forward XM для распределений с чрезвычайно большим числом мод (например, генерация изображений) всё ещё слишком затратен — всё это осталось для последующих работ.
Более десяти лет мы привыкли настраивать генеративные модели двумя регуляторами: делать их больше и кормить их большим количеством данных.
Третий регулятор, предложенный в этой статье, довольно прост: позволить модели угадать несколько раз и оставить только лучший результат. Но если выявленный ею тренд верен, то по мере дальнейшего роста масштабов первые два регулятора рано или поздно будут закручены до предела, а третий только начинает вращаться.
Ссылки
https://x.com/AlexiGlad/status/2083230922196107288
Эта статья взята с официального аккаунта WeChat «Machine Heart (机器之心)» (ID: almosthuman2014), автор: Panda






