Los modelos de texto a imagen (text-to-image) han estado escalando modelo, datos y potencia computacional, pero la cantidad de información en los subtítulos (captions) de las imágenes de entrenamiento rara vez ha sido estudiada como una variable independiente de manera sistemática. El equipo Seed de ByteDance descubrió: un subtítulo en lenguaje natural más largo no significa que el modelo reciba más supervisión visual utilizable; en comparación con la longitud, la cantidad de información vinculada a la imagen en el subtítulo predice mejor la pérdida final de entrenamiento alcanzada por el modelo de difusión.
Basándose en este hallazgo, el equipo propone "Structured Prompt", mejorando la condición de texto desde dos aspectos: Difusabilidad y Capacidad de Prompt, logrando finalmente mejoras significativas en tareas de generación complejas, de composición, razonamiento y conocimiento del mundo.

Figura 1 del artículo | El lenguaje natural se satura rápidamente; la condición estructurada continúa aumentando la información de la imagen y reduce la pérdida de entrenamiento de difusión a lo largo de una relación unificada.
En los últimos años, el progreso de los modelos de texto a imagen ha seguido una ruta familiar: modelos más grandes, más datos y mayor potencia computacional de entrenamiento.
Pero existe una diferencia fácilmente pasada por alto entre los modelos de texto a imagen y los modelos de lenguaje. Los modelos de lenguaje pueden aprender directamente de secuencias de texto a través de aprendizaje autosupervisado; los modelos de texto a imagen, en cambio, dependen del emparejamiento entre imagen y subtítulo para aprender "qué texto corresponde a qué contenido visual". Una imagen puede contener muchos objetos, atributos, posiciones, acciones y relaciones, pero solo las partes que son descritas con precisión y claramente vinculadas por el subtítulo pueden transmitirse como supervisión de condición textual al modelo.
Surge entonces una pregunta fundamental: además de seguir escalando modelo, datos y potencia computacional, ¿podemos hacer que el modelo generativo aprenda mejor aumentando la información de la imagen que transporta el subtítulo?
En este nuevo trabajo, el equipo Seed de ByteDance investigó esta cuestión. La conclusión central se puede resumir en una frase:
Lo que realmente se escala con la condición de texto no es el número de tokens del subtítulo, sino la información de la imagen que puede ser utilizada por el modelo.

- Título del artículo: Scaling Properties of Text Conditioning in Visual Generation
- Autores: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan Institución: ByteDance Seed
- Artículo: https://arxiv.org/abs/2607.29679
- Página del proyecto: https://heheyas.github.io/context-scaling
- Código: https://github.com/heheyas/context-scaling
- Modelos: https://huggingface.co/collections/heheyas/context-scaling
- Demo en línea: https://heheyas-context-scaling.hf.space/
- Artículo en Hugging Face: https://huggingface.co/papers/2607.29679
El Prompt se hace más largo,
¿Por qué el modelo no mejora?
Un enfoque intuitivo es hacer que el subtítulo de entrenamiento o el prompt del usuario sea más largo y detallado. Más tokens parecerían significar más supervisión y deberían ayudar al modelo a generar imágenes más complejas.
Sin embargo, los experimentos dan una respuesta diferente. En varios sistemas de texto a imagen de código abierto existentes, el prompt en lenguaje natural se satura rápidamente al aumentar la longitud, y el rendimiento final incluso cae por debajo del obtenido con sus prompts más cortos. Incluso entrenar específicamente modelos de difusión en el mismo conjunto de subtítulos de texto largo ofrece beneficios muy limitados.
Para ver este fenómeno con mayor claridad, el equipo diseñó un experimento de reconstrucción de imágenes con una arquitectura de red fija. Para una misma imagen de referencia, el equipo generó, a partir de una misma anotación completa, cuatro subtítulos en lenguaje natural de detalle progresivamente creciente, y luego utilizó el mismo modelo Qwen-Image y una semilla aleatoria para intentar reconstruir esa imagen. Estos subtítulos describen las mismas entidades y relaciones; las versiones posteriores principalmente complementan y expanden la expresión en lenguaje natural para aumentar la longitud.
De manera sorprendente, aunque los subtítulos se hicieron significativamente más largos, la calidad de la reconstrucción de la imagen casi no mejoró. La nueva prosa agregada explicaba, reformulaba o conectaba contenido ya presente, pero no añadía continuamente nuevas variables visuales que pudieran usarse de manera estable.

Figura 3 del artículo | Experimento de reconstrucción con backbone fijo: Los subtítulos NL continúan alargándose pero la reconstrucción tiende a saturarse; restaurar gradualmente los campos de SP mejora continuamente.
Esto indica que la longitud del subtítulo es solo una variable proxy muy débil. Un texto puede ser muy largo y aún así no aclarar: a qué objeto pertenece un atributo, qué relación tienen dos objetos, dónde se encuentran, y su profundidad en la escena.
¿Cómo medir la verdadera información de la imagen en un subtítulo?
Si el número de tokens no es suficiente para medir la fuerza de la supervisión, es necesario medir directamente la información vinculada a la imagen en el subtítulo. Para ello, el equipo adaptó dos métricas complementarias de trabajos anteriores: Grounded Perplexity Gain (GPG) y Effective Detailness (ED).
GPG: Cuánto "más predecible" se vuelve el subtítulo gracias a la imagen.
GPG es una métrica de caja blanca que requiere leer las probabilidades de tokens del modelo. Para el mismo subtítulo, el equipo hizo que un modelo de lenguaje visual congelado viera y no viera la imagen emparejada, y calculó la mejora en la verosimilitud logarítmica de los tokens del contenido del subtítulo después de ver la imagen. Si el subtítulo contiene mucha información estrechamente vinculada a esa imagen, verla debería mejorar significativamente la capacidad del modelo para predecir esos tokens.
ED: Cuántos atributos confiables de la imagen cubre el subtítulo.
ED es una métrica semántica de caja negra que no depende de probabilidades de tokens. Extrae atributos con contexto de entidad tanto de la imagen como del subtítulo, y luego calcula la precisión de los atributos del subtítulo y la exhaustividad de los atributos de la imagen. Finalmente, se usa F0.5, que da más peso a la precisión, aplicando un castigo más fuerte a las descripciones en el subtítulo que no tienen base en la imagen.
Las dos métricas abordan el mismo problema desde diferentes ángulos: GPG se centra en la dependencia estadística entre imagen y texto, ED se centra en si el subtítulo cubre con precisión el contenido visual verificable.

Figura 6 del artículo | Definición y tendencias de medición de GPG y ED.
La cantidad de información del subtítulo puede predecir la pérdida de entrenamiento del modelo de difusión
A continuación, el equipo fijó las imágenes, la arquitectura del modelo, la inicialización, la configuración de optimización y el presupuesto de entrenamiento, cambiando solo los subtítulos de entrenamiento. El experimento completo incluyó 15 configuraciones de subtítulos: tres versiones de lenguaje natural de diferente longitud, seis versiones de Structured Prompt que restauran campos gradualmente, y seis variantes de expresión espacial o campos enmascarados. Cada configuración partió del mismo checkpoint de entrenamiento continuado BAGEL y entrenó de forma independiente un modelo de difusión.
Los resultados mostraron que no existe una relación uniforme entre el número de tokens del subtítulo en lenguaje natural y el resultado del entrenamiento; pero cuando el eje horizontal se cambió a la cantidad de información del subtítulo, diferentes formatos y niveles de detalle cayeron en curvas altamente regulares:
- La pérdida de difusión después de la convergencia tiene una relación aproximadamente lineal con GPG, Pearson r = -0.984;
- La pérdida de difusión después de la convergencia sigue una tendencia de ley de potencia con ED, Pearson r = -0.971 en el espacio log-log;
- El ordenamiento de diferentes configuraciones de subtítulos por GPG y ED también es altamente consistente, Spearman ρ = 0.96.
El equipo lo denomina las propiedades de escalado (scaling properties) del condicionamiento de texto. No es una ley teórica que se aplique a todos los modelos, sino una calibración empírica obtenida bajo una arquitectura y receta de entrenamiento fijas. Pero aporta dos valores directos.
Primero, convierte la cantidad de información del subtítulo de un concepto vago de "calidad de los datos" en una variable de entrenamiento que se puede controlar y medir: cuando el modelo, las imágenes y la potencia computacional son constantes, la cantidad de información puede predecir la pérdida de entrenamiento final que alcanzará el modelo.
Segundo, después de realizar una calibración, se pueden comparar primero las opciones de subtítulos candidatos usando GPG o ED bajo la misma receta de entrenamiento, antes de decidir invertir en el costoso entrenamiento del modelo de difusión. Para seis variantes de subtítulos no incluidas en el ajuste, las dos métricas aún pudieron predecir con relativa precisión su pérdida de convergencia.

Figura 7 del artículo | Bajo una receta de entrenamiento fija, la pérdida de convergencia muestra una relación estable con la cantidad de información del subtítulo.
Structured Prompt:
Hacer que la información no solo sea mayor, sino también más fácil de usar por el modelo
Los experimentos anteriores revelan un punto clave: simplemente agregar prosa en lenguaje natural no es suficiente; la nueva información también necesita organizarse de manera estable y clara.
Por lo tanto, el equipo propone Structured Prompt (SP), que utiliza una representación JSON estructurada para las variables visuales en una imagen. Contiene tres niveles:
- Nivel global: intención de la escena, escenario, atmósfera, estilo, iluminación e información fotográfica;
- Nivel de elementos: identidad, atributos, acciones, posición, profundidad opcional e información fotográfica local de cada sujeto;
- Nivel de relaciones: relaciones de posición, oclusión, interacción y semánticas entre diferentes elementos.
En comparación con el texto libre, la clave de SP no es solo la apariencia "JSON", sino colocar diferentes variables visuales en campos con nombre estables, reduciendo la ambigüedad en la pertenencia de atributos, relaciones espaciales y vinculación de objetos. En el experimento de reconstrucción con backbone fijo, a medida que se restauran gradualmente los campos de SP, la calidad de reconstrucción mejora continuamente; en el barrido de entrenamiento completo, el aumento en la cobertura de campos también aumenta simultáneamente GPG, ED y reduce la pérdida de difusión después de la convergencia.

Figura 5 del artículo | Structured Prompt organiza las variables visuales globales, a nivel de elemento y entre elementos en campos con nombre.
Para generar SP completos a gran escala en datos de entrenamiento, el equipo construyó una pipeline de anotación de imagen a SP. Un VLM (Modelo de Lenguaje Visual) genérico se encarga de la semántica global y el contenido local, Sapiens complementa con evidencia de postura humana, DepthAnything V2 proporciona profundidad relativa, SAM 2.1 proporciona máscaras y pistas de oclusión, y finalmente otro VLM unifica esta información en un SP completo y consistente.

Figura 8 del artículo | VLM y expertos en postura, profundidad y segmentación colaboran para construir el Structured Prompt completo.
El equipo denomina Difusabilidad a la capacidad de una representación de subtítulo para exponer y organizar la supervisión visual para el modelo de difusión. Lo que SP mejora es precisamente este aspecto: sin cambiar la arquitectura del modelo de difusión, permite que el modelo aprenda más variables visuales, más explícitas, a partir de la condición de texto.
Capacidad de Prompt (Promptability):
Con una buena estructura, también se necesita un LLM que la complete bien
Durante el entrenamiento, se puede extraer SP completo de imágenes emparejadas, pero en la generación real solo se tiene una frase del usuario, sin imagen de referencia ni anotación oráculo. El sistema también necesita un LLM "prompter" que expanda la solicitud del usuario en un SP detallado, coherente y que no viole las restricciones originales.
El equipo llama Promptabilidad a esta capacidad de instanciar condiciones estructuradas a partir de una solicitud del usuario. La calidad de generación de extremo a extremo depende de la acción conjunta de ambos aspectos:
Calidad de Generación = Difusabilidad × Capacidad de Prompt
El signo de multiplicación aquí es una perspectiva organizativa, no una fórmula matemática de multiplicación obtenida por ajuste: la Difusabilidad describe lo que el modelo de difusión puede aprender de la representación del subtítulo, la Capacidad de Prompt describe si el LLM en la inferencia puede realmente producir instancias de subtítulos de alta calidad.

Figura 4 del artículo | Structured Prompt conecta anotación, medición, entrenamiento del difusor, entrenamiento del prompter y generación final.
Primero, el equipo fijó el esquema SP y el difusor Qwen-Image, reemplazando solo el LLM prompter de cero-shot. A medida que Qwen3.5 escalaba de 0.8B a 397B, GenEval++ en modo "pensamiento" aumentaba del 46.4% al 86.8%. Excepto el modelo más pequeño, que tendía a repetirse en el proceso de pensamiento y no podía producir JSON válido, el chain-of-thought trajo una mejora adicional en otras escalas. Esto indica que la capacidad del modelo y de razonamiento de un LLM genérico puede convertirse directamente en mejores resultados de generación de imágenes a través de la interfaz del subtítulo.
Pero los LLM de cero-shot aún tienden a generar SP con información insuficiente y composiciones simples. Para mejorar aún más la Capacidad de Prompt, el equipo adoptó un entrenamiento en tres etapas:
Fine-tuning Supervisado (SFT) aprende la distribución de contenido SP esperada por el modelo de difusión, no solo el formato JSON;
Arranque en frío (Cold-start) destila "cómo derivar SP solo a partir de la solicitud del usuario" a partir de trazas de razonamiento privilegiadas con imágenes emparejadas;
Fine-tuning con Refuerzo (RFT) continúa optimizando en rollouts generados y renderizados por el propio prompter, filtrando trayectorias de alta confianza mediante un verificador, y luego proporcionando supervisión densa a nivel de token a través de auto-distilación on-policy de un profesor condicionado por imagen.
Los experimentos de ablación muestran que las tres etapas cumplen diferentes funciones: SFT aporta la mayor mejora estructural en una sola etapa, cold-start fortalece la derivación desde la solicitud del usuario hasta SP, y la OPSD con verificación obtiene los resultados más fuertes en la distribución propia del prompter.

Figura 9 del artículo | Con esquema y difusor fijos, la calidad de generación escala con el tamaño del LLM prompter y el modo de razonamiento.

Figura 10 del artículo | Entrenamiento del prompter en tres etapas: SFT, cold-start y RFT con verificación.
La representación estructurada
también facilita la corrección iterativa del proceso de generación
La representación por campos de SP tiene otra ventaja natural: cuando la imagen generada presenta errores, el sistema puede localizar y modificar los campos correspondientes de objeto, atributo, relación o disposición, en lugar de reescribir todo el prompt en lenguaje natural.
Basándose en esto, el equipo construyó un ciclo de refinar-renderizar-juzgar. En cada ronda, el prompter genera o revisa el SP según la solicitud del usuario y el historial de retroalimentación, el difusor fijo renderiza la imagen, y un juez en línea emite un veredicto PASS/FAIL con problemas específicos sobre el seguimiento del prompt, la estructura y la calidad visual. Si falla, la siguiente ronda solo necesita ajustar los campos relevantes.
Los experimentos muestran que aumentar el presupuesto de iteración puede continuar mejorando el rendimiento en estructura, alineación y GSB; pero la longitud efectiva del razonamiento no es larga. Para el prompter entrenado, incluso permitiendo un máximo de 8 rondas, en promedio solo usa 2.31 rondas; aumentar de Tmax = 4 a 8 ya aporta pocos beneficios. Esto indica que la generación de texto a imagen se beneficia de la corrección iterativa de errores, pero en la configuración actual no requiere trayectorias de razonamiento muy largas en el lado del prompt: después de corregir los principales errores de especificación, las rondas adicionales se saturan rápidamente.

Figura 14 del artículo | Ciclo de razonamiento agentico de refinar-renderizar-juzgar.

Figura 15 del artículo | El ciclo puede corregir problemas de división de objetos, relaciones y disposición general.
Con la misma arquitectura Qwen-Image,
¿cuánta mejora aporta la interfaz estructurada?
El sistema final está compuesto por un difusor entrenado con SP y un LLM prompter entrenado. Supera a casi todos los modelos de pesos abiertos comparados en casi todas las métricas reportadas, y alcanza o supera a los sistemas cerrados comparados en la mayoría de las evaluaciones, con ventajas especialmente evidentes en tareas de composición, razonamiento y conocimiento del mundo.
Lo más crucial es el control emparejado. Para excluir la explicación de "simplemente se entrenó un poco más", el equipo utilizó exactamente la misma arquitectura Qwen-Image, las mismas imágenes de entrenamiento, las mismas fases de entrenamiento y el mismo presupuesto, para entrenar un sistema adicional que siempre utiliza subtítulos de lenguaje natural libre. Los resultados son los siguientes:

Tabla 2 del artículo | Comparación completa con sistemas representativos de texto a imagen. La captura conserva las definiciones de evaluación, negritas y notas al pie del artículo original.
El entrenamiento adicional con NL emparejado sí aporta algunas mejoras, pero está lejos de replicar los resultados del sistema SP. Esto indica que el beneficio no puede atribuirse simplemente a un backbone más grande o más entrenamiento, sino que está estrechamente relacionado con la interfaz de subtítulo estructurado utilizada entre el prompter y el difusor.

Figura 11 del artículo | Comparación cualitativa de relaciones espaciales complejas, números y vinculación de atributos.
El siguiente paso no es solo escalar el modelo,
sino también escalar la condición misma
El punto de partida de este trabajo es simple: para los modelos de texto a imagen, el subtítulo no es un metadato irrelevante, sino la interfaz principal a través de la cual el contenido de la imagen ingresa al aprendizaje de la condición textual.
Cuando el subtítulo solo se alarga, los nuevos tokens pueden ser solo reformulaciones y adornos; cuando la información de la imagen se extrae con precisión, se vincula claramente y se organiza de manera estable, el mismo modelo generativo puede aprender más de ella. GPG y ED convierten esta información en una variable medible, Structured Prompt mejora la Difusabilidad, y el escalado de LLM, el post-entrenamiento y el refinamiento agéntico de corto alcance mejoran la Capacidad de Prompt.
Por lo tanto, el próximo escalado en texto a imagen no debería centrarse solo en "qué tan grande es el modelo responsable de la renderización", sino también en:
¿Cuánta información de la imagen que realmente puede aprender y utilizar transporta la condición de texto que se le pasa al modelo?
Este artículo proviene del canal oficial de WeChat "Machine Heart" (机器之心).







