Модели генерации изображений по тексту постоянно увеличивают масштабы модели, данных и вычислительных ресурсов, но информационная ёмкость подписей (Caption), сопровождающих обучающие изображения, редко систематически изучалась как независимая переменная. Команда ByteDance Seed обнаружила: увеличение длины естественноязыковой подписи не означает, что модель получает больше визуального сигнала для обучения; по сравнению с длиной, количество информации в подписи, привязанной к изображению, лучше предсказывает итоговую функцию потерь диффузионной модели после обучения.
Основываясь на этом открытии, команда предложила Structured Prompt (Структурированный промпт) и совместно улучшила текстовое условие с двух сторон: Diffusability (способность к диффузии) и Promptability (управляемость промптом), что в итоге привело к значительному повышению качества в задачах генерации со сложной композицией, логическим выводом и использованием мировых знаний.

Рисунок 1 из статьи | Естественный язык быстро насыщается; структурированное условие постоянно увеличивает визуальную информацию и по единой зависимости снижает функцию потерь при обучении диффузии.
В последние годы прогресс в моделях генерации изображений по тексту развивался почти по знакомому пути: большие модели, больше данных и более мощные вычислительные ресурсы для обучения.
Но между моделями генерации изображений по тексту и языковыми моделями существует легко упускаемое из виду различие. Языковые модели могут обучаться напрямую на текстовых последовательностях методом самоконтроля; модели генерации изображений по тексту полагаются на пары «изображение-подпись», изучая, «какой текст соответствует какому визуальному содержанию». Изображение может содержать множество объектов, атрибутов, позиций, действий и отношений, но только та часть, которая точно описана и чётко привязана в подписи, может быть передана модели в качестве текстового условия для обучения.
Таким образом, возникает фундаментальный вопрос: помимо дальнейшего увеличения масштабов модели, данных и вычислительных ресурсов, можем ли мы заставить модель учиться лучше, увеличивая количество визуальной информации, передаваемой в подписи?
В этой новой работе команда ByteDance Seed исследовала этот вопрос. Основной вывод можно сформулировать одной фразой:
То, что действительно масштабируется вместе с текстовым условием, — это не количество токенов в подписи, а количество информации об изображении, которую модель может использовать.

- Название статьи: Scaling Properties of Text Conditioning in Visual Generation
- Авторы: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan Организация: ByteDance Seed
- Статья: https://arxiv.org/abs/2607.29679
- Домашняя страница проекта: https://heheyas.github.io/context-scaling
- Код: https://github.com/heheyas/context-scaling
- Модель: https://huggingface.co/collections/heheyas/context-scaling
- Онлайн-демо: https://heheyas-context-scaling.hf.space/
- Hugging Face Paper: https://huggingface.co/papers/2607.29679
Промпт стал длиннее,
Почему модель не стала лучше?
Интуитивно понятным решением является написание обучающих подписей или пользовательских промптов длиннее и подробнее. Больше токенов, кажется, должно означать больше сигнала для обучения и должно помогать модели генерировать более сложные изображения.
Однако эксперименты дали другой ответ. В различных существующих открытых системах генерации изображений по тексту производительность естественноязыкового промпта быстро насыщается с увеличением длины, и итоговый результат даже ниже, чем у их собственных самых коротких промптов. Даже если специально обучать диффузионную модель на одном и том же наборе длинных текстовых подписей, выгода весьма ограничена.
Чтобы яснее увидеть это явление, команда разработала эксперимент по реконструкции изображения с фиксированной базовой архитектурой сети. Для одного и того же эталонного изображения команда, исходя из одной и той же полной аннотации, сгенерировала четыре естественноязыковые подписи с постепенно увеличивающейся детализацией, а затем с использованием одной и той же модели Qwen-Image и случайного сида попыталась восстановить это изображение. Эти подписи описывают одни и те же сущности и отношения, последующие версии в основном увеличивают длину за счёт дополнения и развёртывания естественноязыковых выражений.
Неожиданно, хотя подпись значительно удлинилась, качество реконструкции изображения почти не улучшилось. Добавленная проза в основном объясняла, перефразировала или связывала уже появившееся содержание, а не постоянно добавляла новые, стабильно используемые визуальные переменные.

Рисунок 3 из статьи | Эксперимент с реконструкцией при фиксированной архитектуре: реконструкция на основе NL Caption перестаёт улучшаться после увеличения длины, а постепенное восстановление полей SP постоянно улучшает результат.
Это показывает, что длина подписи — лишь очень слабый прокси-показатель. Текст может быть написан очень длинно, но при этом всё равно не ясно: какой атрибут принадлежит какому объекту, какие отношения между двумя объектами, где они расположены и каков их порядок наложения на изображении.
Как измерить настоящую визуальную информацию в подписи?
Если количества токенов недостаточно для измерения силы сигнала обучения, необходимо напрямую измерить информацию в подписи, связанную с изображением. Для этого команда адаптировала из предыдущих работ два взаимодополняющих показателя: Grounded Perplexity Gain (GPG) и Effective Detailness (ED).
GPG: Насколько изображение делает подпись «более предсказуемой».
GPG — это показатель «белого ящика», требующий доступа к вероятностям токенов модели. Для одной и той же подписи команда попеременно предоставляла замороженной визуально-языковой модели доступ к парному изображению и лишала его, и вычисляла увеличение логарифмического правдоподобия токенов содержания подписи после появления изображения. Если подпись содержит много информации, тесно связанной с данным изображением, его просмотр должен значительно повысить способность модели предсказывать эти токены.
ED: Сколько достоверных атрибутов изображения покрывает подпись.
ED — это семантический показатель «чёрного ящика», не зависящий от вероятностей токенов. Он отдельно извлекает атрибуты с контекстом сущностей из изображения и подписи, а затем вычисляет точность атрибутов подписи и полноту атрибутов изображения. В итоге используется F0.5, который больше внимания уделяет точности, налагая более строгое наказание на описания в подписи, не имеющие визуального обоснования.
Два показателя с разных сторон описывают одну и ту же проблему: GPG фокусируется на статистической зависимости между изображением и текстом, ED — на том, точно ли подпись покрывает проверяемое визуальное содержание.

Рисунок 6 из статьи | Определение и тренды измерения GPG и ED.
Количество информации в подписи может предсказать функцию потерь диффузионной модели при обучении
Далее команда зафиксировала изображения, архитектуру модели, способ инициализации, конфигурацию оптимизатора и бюджет обучения, изменяя только обучающие подписи. Весь эксперимент включает 15 конфигураций подписей: три версии естественного языка разной длины, шесть версий Structured Prompt с постепенным восстановлением полей, а также шесть вариантов с пространственным выражением или маскированием полей. Каждая конфигурация начинала с одного и того же контрольного чекпоинта BAGEL continued-training, и независимо обучала одну диффузионную модель.
Результаты показали, что между количеством токенов в естественноязыковой подписи и результатом обучения нет единообразной зависимости; но когда по оси абсцисс откладывается количество информации в подписи, разные форматы и степени детализации конфигураций ложатся на высоко регулярные кривые:
- Сходившаяся функция потерь диффузионной модели (diffusion loss) приблизительно линейно связана с GPG, коэффициент корреляции Пирсона r = -0.984;
- Сходившаяся diffusion loss демонстрирует степенную зависимость от ED, коэффициент корреляции Пирсона в лог-логарифмическом пространстве r = -0.971;
- Ранжирование разных конфигураций подписей по GPG и ED также высоко согласовано, коэффициент ранговой корреляции Спирмена ρ = 0.96.
Команда называет это scaling properties (свойствами масштабирования) текстового условия. Это не теоретический закон, верный для всех моделей, а эмпирическая калибровка, полученная при фиксированной архитектуре и рецепте обучения. Но это приносит две непосредственные выгоды.
Во-первых, это превращает количество информации в подписи из расплывчатого понятия «качество данных» в обучаемую переменную, которой можно управлять и измерять: при неизменных модели, изображениях и вычислительных ресурсах, количество информации может предсказать итоговую функцию потерь модели после обучения.
Во-вторых, после выполнения однократной калибровки, можно в рамках одного рецепта обучения сначала сравнить кандидатные варианты подписей с помощью GPG или ED, а затем решить, стоит ли вкладываться в дорогостоящее обучение диффузионной модели. Для шести вариантов подписей, не участвовавших в подгонке, оба показателя всё ещё достаточно точно предсказывают их итоговые потери.

Рисунок 7 из статьи | При фиксированном рецепте обучения сходившаяся функция потерь демонстрирует устойчивую зависимость от количества информации в подписи.
Structured Prompt:
Чтобы информация была не только больше, но и легче для использования моделью
Предыдущие эксперименты выявили ключевую точку: простого увеличения естественноязыковой прозы недостаточно, новая информация также должна быть организована стабильным и однозначным образом.
Поэтому команда предлагает Structured Prompt (SP), использующий структурированное JSON-представление для визуальных переменных на изображении. Оно включает три уровня:
- Глобальный уровень: намерение сцены, сцена, атмосфера, стиль, освещение и фотографическая информация;
- Уровень элементов: идентификация, атрибуты, действия, положение, опциональная глубина и локальная фотографическая информация для каждого субъекта;
- Уровень отношений: пространственные отношения, перекрытие, взаимодействие и семантические связи между разными элементами.
По сравнению со свободным текстом, ключевое отличие SP не только во внешнем виде «JSON», а в том, что различные визуальные переменные помещаются в стабильные именованные поля, уменьшая неоднозначность в принадлежности атрибутов, пространственных отношениях и привязке объектов. В эксперименте с реконструкцией при фиксированной архитектуре, по мере постепенного восстановления полей SP качество реконструкции постоянно повышалось; в полном исследовании (sweep) увеличение покрытия полей также синхронно повышало GPG, ED и снижало итоговую функцию потерь диффузионной модели.

Рисунок 5 из статьи | Structured Prompt организует глобальные, элементные и межэлементные визуальные переменные в именованные поля.
Для генерации полных SP на данных крупномасштабного обучения команда построила конвейер аннотирования image-to-SP. Универсальная VLM отвечает за глобальную семантику и локальное содержание, Sapiens дополняет доказательствами позы человека, DepthAnything V2 предоставляет относительную глубину, SAM 2.1 предоставляет маски и информацию о перекрытии, и, наконец, VLM унифицирует эту информацию в согласованный полный SP.

Рисунок 8 из статьи | VLM вместе с экспертами по позам, глубине и сегментации совместно строят полный Structured Prompt.
Команда называет способность представления подписи раскрывать и организовывать визуальный сигнал для диффузионной модели — Diffusability (способность к диффузии). SP улучшает именно эту сторону: не меняя архитектуру диффузионной модели, позволяет ей изучить из текстового условия больше и более чётких визуальных переменных.
Promptability:
Имея хорошую структуру, нужна ещё и LLM, чтобы её правильно заполнить
Во время обучения можно извлечь полный SP из парного изображения, но при реальной генерации есть только фраза пользователя, нет эталонного изображения или «оракульной» аннотации. Системе также нужен LLM prompter, чтобы расширить запрос пользователя до детального, связного SP, не нарушающего исходных ограничений.
Команда называет эту способность инстанцировать структурированное условие из запроса пользователя — Promptability (управляемость промптом). Качество сквозной генерации зависит от совместного действия обеих сторон:
Generation Quality = Diffusability × Promptability
Здесь знак умножения — это организационная перспектива, а не математическая формула, полученная путём подгонки: Diffusability описывает, что диффузионная модель может изучить из представления подписи, Promptability описывает, может ли LLM во время логического вывода действительно заполнить качественный экземпляр подписи.

Рисунок 4 из статьи | Structured Prompt связывает аннотирование, измерение, обучение диффузионной модели, обучение промптера и итоговую генерацию.
Сначала команда зафиксировала схему SP и диффузионную модель Qwen-Image, заменяя только LLM prompter с нулевым сэмплированием (zero-shot). По мере масштабирования Qwen3.5 от 0.8B до 397B, показатель GenEval++ в режиме мышления (thinking mode) вырос с 46.4% до 86.8%. За исключением самой маленькой модели, которая склонна повторяться в процессе размышления и не может выдать валидный JSON, цепочка мыслей (chain-of-thought) на всех остальных масштабах приносила дальнейшее улучшение. Это показывает, что возможности модели и логического вывода у универсальных LLM могут быть напрямую преобразованы в лучшие результаты генерации изображений через интерфейс подписи.
Но LLM с нулевым сэмплированием всё ещё склонны генерировать SP с недостаточной информацией и относительно простой композицией. Для дальнейшего повышения Promptability команда применила трёхэтапное обучение:
SFT (Supervised Fine-Tuning) изучает распределение контента SP, ожидаемое диффузионной моделью, а не только формат JSON;
Cold-start (Холодный старт) дистиллирует из трасс рассуждений с привилегированным доступом к изображениям «как вывести SP, основываясь только на запросе пользователя»;
RFT (Reinforcement Fine-Tuning) продолжает оптимизацию на rollout'ах, сгенерированных и отрисованных самим промптером, где verifier отбирает траектории с высокой уверенностью, а затем обеспечивает плотный пошаговый сигнал обучения через on-policy self-distillation (OPSD) от учителя с доступом к изображению.
Эксперименты с исключением компонентов показывают, что три этапа выполняют разные функции: SFT даёт наибольшее одноэтапное улучшение структуры, cold-start усиливает вывод от запроса пользователя к SP, а verifier-gated OPSD достигает наилучших результатов на распределении самого промптера.

Рисунок 9 из статьи | При фиксированных схеме SP и диффузионной модели, качество генерации растёт с увеличением масштаба LLM промптера и использованием режима рассуждений.

Рисунок 10 из статьи | Трёхэтапное обучение промптера: SFT, cold-start и verifier-gated RFT.
Структурированное представление
также облегчает итеративное исправление процесса генерации
Полевое представление SP также имеет естественное преимущество: когда в сгенерированном изображении возникает ошибка, система может локализовать и изменить соответствующие поля объекта, атрибута, отношения или компоновки, вместо того чтобы переписывать всю естественноязыковую подпись заново.
На основе этого команда построила цикл refine-render-judge (уточнение-рендеринг-оценка). В каждом раунде промптер генерирует или редактирует SP на основе запроса пользователя и предыдущей обратной связи, фиксированная диффузионная модель отрисовывает изображение, а онлайн-оценщик (judge) затем выдаёт PASS/FAIL и конкретные проблемы по критериям следования промпту, структуре и визуальному качеству. В случае неудачи, следующий раунд требует корректировки только вокруг связанных полей.
Эксперименты показывают, что увеличение итерационного бюджета позволяет продолжить улучшение показателей по структуре, соответствию и GSB; однако эффективная длина рассуждений невелика. Для обученного промптера, даже при разрешении до 8 раундов, в среднем используется только 2.31 раунда; увеличение Tmax с 4 до 8 даёт уже очень маленький прирост. Это указывает, что генерация изображений по тексту действительно выигрывает от итеративного исправления ошибок, но в текущей настройке не требует очень длинных траекторий рассуждений на стороне промпта: после исправления основных ошибок спецификации дополнительные раунды быстро насыщаются.

Рисунок 14 из статьи | Агентный цикл рассуждений refine-render-judge.

Рисунок 15 из статьи | Цикл позволяет исправлять проблемы разделения объектов, отношений и общей компоновки.
Одна и та же архитектура Qwen-Image,
насколько структурированный интерфейс улучшил результат?
Итоговая система состоит из обученной на SP диффузионной модели и обученного LLM промптера. Она превосходит все сравниваемые модели с открытыми весами почти по всем заявленным метрикам и в большинстве оценок достигает или превосходит сравниваемые закрытые системы, причём преимущество особенно заметно в задачах композиции, логического вывода и использования мировых знаний.
Что ещё важнее — это сравнение на сопоставимых условиях (matched control). Чтобы исключить объяснение «просто потренировали немного больше», команда с использованием абсолютно той же архитектуры Qwen-Image, обучающих изображений, этапов и бюджета обучения, дополнительно обучила систему, которая всегда использовала свободные естественноязыковые подписи. Результаты следующие:

Таблица 2 из статьи | Полное сравнение с репрезентативными системами генерации изображений по тексту. Скриншот сохраняет определения критериев, выделение жирным и сноски из статьи.
Дополнительное обучение на сопоставимой NL (matched NL) действительно принесло некоторое улучшение, но его недостаточно для воспроизведения результатов системы SP. Это показывает, что выгоду нельзя просто объяснить более крупной архитектурой (backbone) или большим количеством обучения, она тесно связана со структурированным интерфейсом подписи, используемым между промптером и диффузионной моделью.

Рисунок 11 из статьи | Качественное сравнение сложных пространственных отношений, количества и привязки атрибутов.
Следующий шаг — не только масштабировать модель,
но и масштабировать само условие
Исходная точка этой работы проста: для моделей генерации изображений по тексту подпись — это не несущественные метаданные, а основной интерфейс, через который визуальное содержание поступает в процесс обучения на основе текстового условия.
Когда подпись просто становится длиннее, новые токены могут быть лишь перефразированием и развёртыванием; когда информация об изображении точно извлечена, чётко привязана и стабильно организована, одна и та же генерирующая модель может изучить из неё больше. GPG и ED делают эту информацию измеримой переменной, Structured Prompt повышает Diffusability, а масштабирование LLM, пост-обучение и краткосрочное агентное уточнение повышают Promptability.
Таким образом, следующий шаг в масштабировании генерации изображений по тексту должен быть направлен не только на вопрос «насколько большая модель отвечает за рендеринг?», но и на вопрос:
Сколько информации об изображении, которую модель действительно может изучить и использовать, передаётся в текстовом условии?
Эта статья из WeChat официального аккаунта «Машина-сердце» (机器之心)








