Nueva variable de escalado en modelos de texto a imagen, descubierta por el equipo Seed de ByteDance

marsbitPublicado a 2026-08-12Actualizado a 2026-08-12

Resumen

El equipo Seed de ByteDance identifica que la información visual utilizable en los textos descriptivos (captions) de las imágenes es un factor clave para el entrenamiento de modelos de generación de imagen a partir de texto, más importante que la mera longitud del texto. Proponen el "Prompt Estructurado" (SP), una representación JSON que organiza claramente elementos, atributos y relaciones visuales, mejorando significativamente la capacidad del modelo para aprender y generar imágenes complejas. La calidad final del sistema depende de dos aspectos: la "Difusabilidad" (cuánta información visual útil puede extraer el modelo difusor del SP) y la "Capacidad de Prompt" (la habilidad de un modelo de lenguaje para generar SP detallados y precisos a partir de instrucciones del usuario). El trabajo incluye métodos para medir la información en los captions y un ciclo iterativo de refinamiento, mostrando mejoras notables en tareas que requieren composición, razonamiento y conocimiento del mundo.

Los modelos de texto a imagen (text-to-image) han estado escalando modelo, datos y potencia computacional, pero la cantidad de información en los subtítulos (captions) de las imágenes de entrenamiento rara vez ha sido estudiada como una variable independiente de manera sistemática. El equipo Seed de ByteDance descubrió: un subtítulo en lenguaje natural más largo no significa que el modelo reciba más supervisión visual utilizable; en comparación con la longitud, la cantidad de información vinculada a la imagen en el subtítulo predice mejor la pérdida final de entrenamiento alcanzada por el modelo de difusión.

Basándose en este hallazgo, el equipo propone "Structured Prompt", mejorando la condición de texto desde dos aspectos: Difusabilidad y Capacidad de Prompt, logrando finalmente mejoras significativas en tareas de generación complejas, de composición, razonamiento y conocimiento del mundo.

Figura 1 del artículo | El lenguaje natural se satura rápidamente; la condición estructurada continúa aumentando la información de la imagen y reduce la pérdida de entrenamiento de difusión a lo largo de una relación unificada.

En los últimos años, el progreso de los modelos de texto a imagen ha seguido una ruta familiar: modelos más grandes, más datos y mayor potencia computacional de entrenamiento.

Pero existe una diferencia fácilmente pasada por alto entre los modelos de texto a imagen y los modelos de lenguaje. Los modelos de lenguaje pueden aprender directamente de secuencias de texto a través de aprendizaje autosupervisado; los modelos de texto a imagen, en cambio, dependen del emparejamiento entre imagen y subtítulo para aprender "qué texto corresponde a qué contenido visual". Una imagen puede contener muchos objetos, atributos, posiciones, acciones y relaciones, pero solo las partes que son descritas con precisión y claramente vinculadas por el subtítulo pueden transmitirse como supervisión de condición textual al modelo.

Surge entonces una pregunta fundamental: además de seguir escalando modelo, datos y potencia computacional, ¿podemos hacer que el modelo generativo aprenda mejor aumentando la información de la imagen que transporta el subtítulo?

En este nuevo trabajo, el equipo Seed de ByteDance investigó esta cuestión. La conclusión central se puede resumir en una frase:

Lo que realmente se escala con la condición de texto no es el número de tokens del subtítulo, sino la información de la imagen que puede ser utilizada por el modelo.

  • Título del artículo: Scaling Properties of Text Conditioning in Visual Generation
  • Autores: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan Institución: ByteDance Seed
  • Artículo: https://arxiv.org/abs/2607.29679
  • Página del proyecto: https://heheyas.github.io/context-scaling
  • Código: https://github.com/heheyas/context-scaling
  • Modelos: https://huggingface.co/collections/heheyas/context-scaling
  • Demo en línea: https://heheyas-context-scaling.hf.space/
  • Artículo en Hugging Face: https://huggingface.co/papers/2607.29679

El Prompt se hace más largo,

¿Por qué el modelo no mejora?

Un enfoque intuitivo es hacer que el subtítulo de entrenamiento o el prompt del usuario sea más largo y detallado. Más tokens parecerían significar más supervisión y deberían ayudar al modelo a generar imágenes más complejas.

Sin embargo, los experimentos dan una respuesta diferente. En varios sistemas de texto a imagen de código abierto existentes, el prompt en lenguaje natural se satura rápidamente al aumentar la longitud, y el rendimiento final incluso cae por debajo del obtenido con sus prompts más cortos. Incluso entrenar específicamente modelos de difusión en el mismo conjunto de subtítulos de texto largo ofrece beneficios muy limitados.

Para ver este fenómeno con mayor claridad, el equipo diseñó un experimento de reconstrucción de imágenes con una arquitectura de red fija. Para una misma imagen de referencia, el equipo generó, a partir de una misma anotación completa, cuatro subtítulos en lenguaje natural de detalle progresivamente creciente, y luego utilizó el mismo modelo Qwen-Image y una semilla aleatoria para intentar reconstruir esa imagen. Estos subtítulos describen las mismas entidades y relaciones; las versiones posteriores principalmente complementan y expanden la expresión en lenguaje natural para aumentar la longitud.

De manera sorprendente, aunque los subtítulos se hicieron significativamente más largos, la calidad de la reconstrucción de la imagen casi no mejoró. La nueva prosa agregada explicaba, reformulaba o conectaba contenido ya presente, pero no añadía continuamente nuevas variables visuales que pudieran usarse de manera estable.

Figura 3 del artículo | Experimento de reconstrucción con backbone fijo: Los subtítulos NL continúan alargándose pero la reconstrucción tiende a saturarse; restaurar gradualmente los campos de SP mejora continuamente.

Esto indica que la longitud del subtítulo es solo una variable proxy muy débil. Un texto puede ser muy largo y aún así no aclarar: a qué objeto pertenece un atributo, qué relación tienen dos objetos, dónde se encuentran, y su profundidad en la escena.

¿Cómo medir la verdadera información de la imagen en un subtítulo?

Si el número de tokens no es suficiente para medir la fuerza de la supervisión, es necesario medir directamente la información vinculada a la imagen en el subtítulo. Para ello, el equipo adaptó dos métricas complementarias de trabajos anteriores: Grounded Perplexity Gain (GPG) y Effective Detailness (ED).

GPG: Cuánto "más predecible" se vuelve el subtítulo gracias a la imagen.

GPG es una métrica de caja blanca que requiere leer las probabilidades de tokens del modelo. Para el mismo subtítulo, el equipo hizo que un modelo de lenguaje visual congelado viera y no viera la imagen emparejada, y calculó la mejora en la verosimilitud logarítmica de los tokens del contenido del subtítulo después de ver la imagen. Si el subtítulo contiene mucha información estrechamente vinculada a esa imagen, verla debería mejorar significativamente la capacidad del modelo para predecir esos tokens.

ED: Cuántos atributos confiables de la imagen cubre el subtítulo.

ED es una métrica semántica de caja negra que no depende de probabilidades de tokens. Extrae atributos con contexto de entidad tanto de la imagen como del subtítulo, y luego calcula la precisión de los atributos del subtítulo y la exhaustividad de los atributos de la imagen. Finalmente, se usa F0.5, que da más peso a la precisión, aplicando un castigo más fuerte a las descripciones en el subtítulo que no tienen base en la imagen.

Las dos métricas abordan el mismo problema desde diferentes ángulos: GPG se centra en la dependencia estadística entre imagen y texto, ED se centra en si el subtítulo cubre con precisión el contenido visual verificable.

Figura 6 del artículo | Definición y tendencias de medición de GPG y ED.

La cantidad de información del subtítulo puede predecir la pérdida de entrenamiento del modelo de difusión

A continuación, el equipo fijó las imágenes, la arquitectura del modelo, la inicialización, la configuración de optimización y el presupuesto de entrenamiento, cambiando solo los subtítulos de entrenamiento. El experimento completo incluyó 15 configuraciones de subtítulos: tres versiones de lenguaje natural de diferente longitud, seis versiones de Structured Prompt que restauran campos gradualmente, y seis variantes de expresión espacial o campos enmascarados. Cada configuración partió del mismo checkpoint de entrenamiento continuado BAGEL y entrenó de forma independiente un modelo de difusión.

Los resultados mostraron que no existe una relación uniforme entre el número de tokens del subtítulo en lenguaje natural y el resultado del entrenamiento; pero cuando el eje horizontal se cambió a la cantidad de información del subtítulo, diferentes formatos y niveles de detalle cayeron en curvas altamente regulares:

  • La pérdida de difusión después de la convergencia tiene una relación aproximadamente lineal con GPG, Pearson r = -0.984;
  • La pérdida de difusión después de la convergencia sigue una tendencia de ley de potencia con ED, Pearson r = -0.971 en el espacio log-log;
  • El ordenamiento de diferentes configuraciones de subtítulos por GPG y ED también es altamente consistente, Spearman ρ = 0.96.

El equipo lo denomina las propiedades de escalado (scaling properties) del condicionamiento de texto. No es una ley teórica que se aplique a todos los modelos, sino una calibración empírica obtenida bajo una arquitectura y receta de entrenamiento fijas. Pero aporta dos valores directos.

Primero, convierte la cantidad de información del subtítulo de un concepto vago de "calidad de los datos" en una variable de entrenamiento que se puede controlar y medir: cuando el modelo, las imágenes y la potencia computacional son constantes, la cantidad de información puede predecir la pérdida de entrenamiento final que alcanzará el modelo.

Segundo, después de realizar una calibración, se pueden comparar primero las opciones de subtítulos candidatos usando GPG o ED bajo la misma receta de entrenamiento, antes de decidir invertir en el costoso entrenamiento del modelo de difusión. Para seis variantes de subtítulos no incluidas en el ajuste, las dos métricas aún pudieron predecir con relativa precisión su pérdida de convergencia.

Figura 7 del artículo | Bajo una receta de entrenamiento fija, la pérdida de convergencia muestra una relación estable con la cantidad de información del subtítulo.

Structured Prompt:

Hacer que la información no solo sea mayor, sino también más fácil de usar por el modelo

Los experimentos anteriores revelan un punto clave: simplemente agregar prosa en lenguaje natural no es suficiente; la nueva información también necesita organizarse de manera estable y clara.

Por lo tanto, el equipo propone Structured Prompt (SP), que utiliza una representación JSON estructurada para las variables visuales en una imagen. Contiene tres niveles:

  • Nivel global: intención de la escena, escenario, atmósfera, estilo, iluminación e información fotográfica;
  • Nivel de elementos: identidad, atributos, acciones, posición, profundidad opcional e información fotográfica local de cada sujeto;
  • Nivel de relaciones: relaciones de posición, oclusión, interacción y semánticas entre diferentes elementos.

En comparación con el texto libre, la clave de SP no es solo la apariencia "JSON", sino colocar diferentes variables visuales en campos con nombre estables, reduciendo la ambigüedad en la pertenencia de atributos, relaciones espaciales y vinculación de objetos. En el experimento de reconstrucción con backbone fijo, a medida que se restauran gradualmente los campos de SP, la calidad de reconstrucción mejora continuamente; en el barrido de entrenamiento completo, el aumento en la cobertura de campos también aumenta simultáneamente GPG, ED y reduce la pérdida de difusión después de la convergencia.

Figura 5 del artículo | Structured Prompt organiza las variables visuales globales, a nivel de elemento y entre elementos en campos con nombre.

Para generar SP completos a gran escala en datos de entrenamiento, el equipo construyó una pipeline de anotación de imagen a SP. Un VLM (Modelo de Lenguaje Visual) genérico se encarga de la semántica global y el contenido local, Sapiens complementa con evidencia de postura humana, DepthAnything V2 proporciona profundidad relativa, SAM 2.1 proporciona máscaras y pistas de oclusión, y finalmente otro VLM unifica esta información en un SP completo y consistente.

Figura 8 del artículo | VLM y expertos en postura, profundidad y segmentación colaboran para construir el Structured Prompt completo.

El equipo denomina Difusabilidad a la capacidad de una representación de subtítulo para exponer y organizar la supervisión visual para el modelo de difusión. Lo que SP mejora es precisamente este aspecto: sin cambiar la arquitectura del modelo de difusión, permite que el modelo aprenda más variables visuales, más explícitas, a partir de la condición de texto.

Capacidad de Prompt (Promptability):

Con una buena estructura, también se necesita un LLM que la complete bien

Durante el entrenamiento, se puede extraer SP completo de imágenes emparejadas, pero en la generación real solo se tiene una frase del usuario, sin imagen de referencia ni anotación oráculo. El sistema también necesita un LLM "prompter" que expanda la solicitud del usuario en un SP detallado, coherente y que no viole las restricciones originales.

El equipo llama Promptabilidad a esta capacidad de instanciar condiciones estructuradas a partir de una solicitud del usuario. La calidad de generación de extremo a extremo depende de la acción conjunta de ambos aspectos:

Calidad de Generación = Difusabilidad × Capacidad de Prompt

El signo de multiplicación aquí es una perspectiva organizativa, no una fórmula matemática de multiplicación obtenida por ajuste: la Difusabilidad describe lo que el modelo de difusión puede aprender de la representación del subtítulo, la Capacidad de Prompt describe si el LLM en la inferencia puede realmente producir instancias de subtítulos de alta calidad.

Figura 4 del artículo | Structured Prompt conecta anotación, medición, entrenamiento del difusor, entrenamiento del prompter y generación final.

Primero, el equipo fijó el esquema SP y el difusor Qwen-Image, reemplazando solo el LLM prompter de cero-shot. A medida que Qwen3.5 escalaba de 0.8B a 397B, GenEval++ en modo "pensamiento" aumentaba del 46.4% al 86.8%. Excepto el modelo más pequeño, que tendía a repetirse en el proceso de pensamiento y no podía producir JSON válido, el chain-of-thought trajo una mejora adicional en otras escalas. Esto indica que la capacidad del modelo y de razonamiento de un LLM genérico puede convertirse directamente en mejores resultados de generación de imágenes a través de la interfaz del subtítulo.

Pero los LLM de cero-shot aún tienden a generar SP con información insuficiente y composiciones simples. Para mejorar aún más la Capacidad de Prompt, el equipo adoptó un entrenamiento en tres etapas:

Fine-tuning Supervisado (SFT) aprende la distribución de contenido SP esperada por el modelo de difusión, no solo el formato JSON;

Arranque en frío (Cold-start) destila "cómo derivar SP solo a partir de la solicitud del usuario" a partir de trazas de razonamiento privilegiadas con imágenes emparejadas;

Fine-tuning con Refuerzo (RFT) continúa optimizando en rollouts generados y renderizados por el propio prompter, filtrando trayectorias de alta confianza mediante un verificador, y luego proporcionando supervisión densa a nivel de token a través de auto-distilación on-policy de un profesor condicionado por imagen.

Los experimentos de ablación muestran que las tres etapas cumplen diferentes funciones: SFT aporta la mayor mejora estructural en una sola etapa, cold-start fortalece la derivación desde la solicitud del usuario hasta SP, y la OPSD con verificación obtiene los resultados más fuertes en la distribución propia del prompter.

Figura 9 del artículo | Con esquema y difusor fijos, la calidad de generación escala con el tamaño del LLM prompter y el modo de razonamiento.

Figura 10 del artículo | Entrenamiento del prompter en tres etapas: SFT, cold-start y RFT con verificación.

La representación estructurada

también facilita la corrección iterativa del proceso de generación

La representación por campos de SP tiene otra ventaja natural: cuando la imagen generada presenta errores, el sistema puede localizar y modificar los campos correspondientes de objeto, atributo, relación o disposición, en lugar de reescribir todo el prompt en lenguaje natural.

Basándose en esto, el equipo construyó un ciclo de refinar-renderizar-juzgar. En cada ronda, el prompter genera o revisa el SP según la solicitud del usuario y el historial de retroalimentación, el difusor fijo renderiza la imagen, y un juez en línea emite un veredicto PASS/FAIL con problemas específicos sobre el seguimiento del prompt, la estructura y la calidad visual. Si falla, la siguiente ronda solo necesita ajustar los campos relevantes.

Los experimentos muestran que aumentar el presupuesto de iteración puede continuar mejorando el rendimiento en estructura, alineación y GSB; pero la longitud efectiva del razonamiento no es larga. Para el prompter entrenado, incluso permitiendo un máximo de 8 rondas, en promedio solo usa 2.31 rondas; aumentar de Tmax = 4 a 8 ya aporta pocos beneficios. Esto indica que la generación de texto a imagen se beneficia de la corrección iterativa de errores, pero en la configuración actual no requiere trayectorias de razonamiento muy largas en el lado del prompt: después de corregir los principales errores de especificación, las rondas adicionales se saturan rápidamente.

Figura 14 del artículo | Ciclo de razonamiento agentico de refinar-renderizar-juzgar.

Figura 15 del artículo | El ciclo puede corregir problemas de división de objetos, relaciones y disposición general.

Con la misma arquitectura Qwen-Image,

¿cuánta mejora aporta la interfaz estructurada?

El sistema final está compuesto por un difusor entrenado con SP y un LLM prompter entrenado. Supera a casi todos los modelos de pesos abiertos comparados en casi todas las métricas reportadas, y alcanza o supera a los sistemas cerrados comparados en la mayoría de las evaluaciones, con ventajas especialmente evidentes en tareas de composición, razonamiento y conocimiento del mundo.

Lo más crucial es el control emparejado. Para excluir la explicación de "simplemente se entrenó un poco más", el equipo utilizó exactamente la misma arquitectura Qwen-Image, las mismas imágenes de entrenamiento, las mismas fases de entrenamiento y el mismo presupuesto, para entrenar un sistema adicional que siempre utiliza subtítulos de lenguaje natural libre. Los resultados son los siguientes:

Tabla 2 del artículo | Comparación completa con sistemas representativos de texto a imagen. La captura conserva las definiciones de evaluación, negritas y notas al pie del artículo original.

El entrenamiento adicional con NL emparejado sí aporta algunas mejoras, pero está lejos de replicar los resultados del sistema SP. Esto indica que el beneficio no puede atribuirse simplemente a un backbone más grande o más entrenamiento, sino que está estrechamente relacionado con la interfaz de subtítulo estructurado utilizada entre el prompter y el difusor.

Figura 11 del artículo | Comparación cualitativa de relaciones espaciales complejas, números y vinculación de atributos.

El siguiente paso no es solo escalar el modelo,

sino también escalar la condición misma

El punto de partida de este trabajo es simple: para los modelos de texto a imagen, el subtítulo no es un metadato irrelevante, sino la interfaz principal a través de la cual el contenido de la imagen ingresa al aprendizaje de la condición textual.

Cuando el subtítulo solo se alarga, los nuevos tokens pueden ser solo reformulaciones y adornos; cuando la información de la imagen se extrae con precisión, se vincula claramente y se organiza de manera estable, el mismo modelo generativo puede aprender más de ella. GPG y ED convierten esta información en una variable medible, Structured Prompt mejora la Difusabilidad, y el escalado de LLM, el post-entrenamiento y el refinamiento agéntico de corto alcance mejoran la Capacidad de Prompt.

Por lo tanto, el próximo escalado en texto a imagen no debería centrarse solo en "qué tan grande es el modelo responsable de la renderización", sino también en:

¿Cuánta información de la imagen que realmente puede aprender y utilizar transporta la condición de texto que se le pasa al modelo?

Este artículo proviene del canal oficial de WeChat "Machine Heart" (机器之心).

Criptos en tendencia

Preguntas relacionadas

Q¿Qué descubrió el equipo Seed de ByteDance respecto a los modelos de generación de texto a imagen?

AEl equipo Seed de ByteDance descubrió que en los modelos de generación de texto a imagen, la longitud de los "Caption" (descripciones) de las imágenes de entrenamiento no se correlaciona necesariamente con una mejor supervisión visual para el modelo. En cambio, la cantidad de información vinculada a la imagen contenida en el "Caption" es un predictor más fuerte de la pérdida final del modelo de difusión durante el entrenamiento.

Q¿Qué es el "Structured Prompt" propuesto por el equipo y cómo mejora el modelo?

AEl "Structured Prompt" (Prompt Estructurado) es una representación en formato JSON propuesta por el equipo. Organiza la información visual en tres niveles: global (intención, escena, atmósfera), de elementos (identidad, atributos, acciones, posición de cada sujeto) y de relaciones (posición, interacciones entre elementos). Mejora el modelo al aumentar la "Diffusability", es decir, al exponer de manera clara y estable más variables visuales al modelo de difusión, lo que permite que aprenda mejor de las condiciones de texto y reduzca ambigüedades.

Q¿Qué métricas introdujeron para medir la información útil en un Caption y en qué se diferencian?

AIntrodujeron dos métricas: "Grounded Perplexity Gain" (GPG) y "Effective Detailness" (ED). La GPG es una métrica de "caja blanca" que mide cuánto mejora la capacidad de un modelo de lenguaje visionario congelado para predecir los tokens del Caption cuando también ve la imagen pareada. La ED es una métrica de "caja negra" semántica que evalúa cuántos atributos verificables de la imagen están cubiertos con precisión por el Caption, penalizando las descripciones sin base visual.

Q¿Cómo contribuye un LLM (Modelo de Lenguaje Grande) a la calidad de generación en este sistema?

AEl LLM actúa como "prompter", su función es la "Promptability": convertir la solicitud breve del usuario en un "Structured Prompt" detallado y coherente durante la inferencia. La calidad final de generación depende de la combinación de la "Diffusability" (capacidad del modelo de difusión para aprender del prompt) y la "Promptability" (capacidad del LLM para generar un buen prompt). Escalar el tamaño del LLM y entrenarlo específicamente (con SFT, cold-start y RFT) mejora significativamente esta capacidad, traduciéndose en imágenes de mayor calidad.

Q¿Qué ventaja ofrece el uso de un "Structured Prompt" para corregir errores en las imágenes generadas?

ALa representación estructurada por campos del "Structured Prompt" permite un proceso iterativo de "refine-render-judge" (refinar-renderizar-juzgar). Cuando una imagen generada tiene un error (ej: un objeto incorrecto o una relación mal posicionada), el sistema puede localizar y modificar solo los campos específicos del JSON correspondientes a ese problema, en lugar de tener que reescribir todo el prompt en lenguaje natural. Esto hace que el proceso de corrección sea más eficiente y dirigido.

Lecturas Relacionadas

Nuevo artículo de Arthur Hayes: Apostando por la apreciación del yen, ENA podría aumentar entre 5 y 10 veces en los próximos meses

Arthur Hayes, en su último artículo "Yen-quake", argumenta que el yen japonés está a punto de apreciarse frente al dólar. La vía más probable, según él, sería que el gobierno japonés utilice el mecanismo FIMA del Banco de la Reserva Federal para obtener préstamos en dólares con sus bonos del Tesoro estadounidense como garantía, y luego use esos dólares para comprar yenes en el mercado de divisas. Hayes descarta otras opciones, como un aumento significativo de las tasas de interés por parte del Banco de Japón o la venta masiva de activos en el extranjero por parte de instituciones japonesas, por sus consecuencias políticas y económicas no deseadas. La implementación del "Plan 3" a través de FIMA, que requeriría eliminar los límites actuales del mecanismo, inyectaría una gran liquidez en dólares en el sistema. Hayes cree que esta expansión monetaria impulsaría los precios de activos como bitcoin y el oro físico. En el ámbito cripto, además de considerar que bitcoin y Ethereum están infravalorados, Hayes señala que Ethena (ENA) tiene el potencial de multiplicar su valor entre 5 y 10 veces en los próximos meses, si un aumento en la liquidez revive los rendimientos de su stablecoin USDe. Concluye que el final de la era del "yen barato" se acerca, y aconseja estar atento a las señales de una próxima modificación de las reglas FIMA.

marsbitHace 15 min(s)

Nuevo artículo de Arthur Hayes: Apostando por la apreciación del yen, ENA podría aumentar entre 5 y 10 veces en los próximos meses

marsbitHace 15 min(s)

Equipo chino de generación de datos logra por primera vez publicar en la revista Nature

Un equipo de Hong Kong, WienerAI, se ha convertido en la primera empresa china de generación de datos y la cuarta del mundo en publicar en una revista principal de Nature (con un factor de impacto >10 en los últimos tres años). Su artículo en *Nature Communications* presenta un modelo de IA que ayuda en la toma de decisiones quirúrgicas para el cáncer renal. Fundada por el profesor Liu Qifeng de HKUST, la empresa se centra en un eslabón crítico del desarrollo de la IA: la generación de datos de preguntas y respuestas de razonamiento de alta calidad. WienerAI busca que los modelos de lenguaje grande no solo "respondan bien", sino que también "pregunten bien", creando así un "bucle de retroalimentación" completo: Datos → Modelo → Token (respuesta) → Nuevos Datos. Este ciclo es clave para que la IA adquiera capacidad de aprendizaje autónomo, especialmente en campos profesionales. La tecnología central de la empresa genera datos estructurados (cQrA: contexto, Pregunta, razonamiento, Respuesta), actuando como un "equipo de expertos" automatizado que produce "libros de ejercicios" para entrenar IA en sectores específicos, superando los cuellos de botella de la anotación manual tradicional. Con una ronda inicial de financiación liderada por Lenovo Capital, WienerAI ha validado su modelo en cuatro industrias dispares (seguridad de valores, administración pública, seguros y hípica), demostrando replicabilidad. La visión del profesor Liu trasciende el mundo digital: este paradigma de ciclo cerrado de generación y optimización de datos es fundamental para el futuro de la IA, incluyendo la IA embodied, donde el contexto evoluciona a cTrA (contexto, Tarea, razonamiento, Acción). Su objetivo final es ambicioso: "¡Generemos este mundo!".

marsbitHace 27 min(s)

Equipo chino de generación de datos logra por primera vez publicar en la revista Nature

marsbitHace 27 min(s)

Trading

Spot

Artículos destacados

Qué es $S$

Entendiendo SPERO: Una Visión General Completa Introducción a SPERO A medida que el panorama de la innovación sigue evolucionando, la aparición de tecnologías web3 y proyectos de criptomonedas juega un papel fundamental en la configuración del futuro digital. Un proyecto que ha llamado la atención en este campo dinámico es SPERO, denotado como SPERO,$$s$. Este artículo tiene como objetivo recopilar y presentar información detallada sobre SPERO, para ayudar a entusiastas e inversores a comprender sus fundamentos, objetivos e innovaciones dentro de los dominios web3 y cripto. ¿Qué es SPERO,$$s$? SPERO,$$s$ es un proyecto único dentro del espacio cripto que busca aprovechar los principios de descentralización y tecnología blockchain para crear un ecosistema que promueva la participación, la utilidad y la inclusión financiera. El proyecto está diseñado para facilitar interacciones entre pares de nuevas maneras, proporcionando a los usuarios soluciones y servicios financieros innovadores. En su esencia, SPERO,$$s$ tiene como objetivo empoderar a los individuos al proporcionar herramientas y plataformas que mejoren la experiencia del usuario en el espacio de las criptomonedas. Esto incluye habilitar métodos de transacción más flexibles, fomentar iniciativas impulsadas por la comunidad y crear caminos para oportunidades financieras a través de aplicaciones descentralizadas (dApps). La visión subyacente de SPERO,$$s$ gira en torno a la inclusividad, buscando cerrar brechas dentro de las finanzas tradicionales mientras aprovecha los beneficios de la tecnología blockchain. ¿Quién es el Creador de SPERO,$$s$? La identidad del creador de SPERO,$$s$ sigue siendo algo oscura, ya que hay recursos públicos limitados que proporcionan información de fondo detallada sobre su(s) fundador(es). Esta falta de transparencia puede derivarse del compromiso del proyecto con la descentralización, una ética que muchos proyectos web3 comparten, priorizando las contribuciones colectivas sobre el reconocimiento individual. Al centrar las discusiones en torno a la comunidad y sus objetivos colectivos, SPERO,$$s$ encarna la esencia del empoderamiento sin señalar a individuos específicos. Como tal, entender la ética y la misión de SPERO es más importante que identificar a un creador singular. ¿Quiénes son los Inversores de SPERO,$$s$? SPERO,$$s$ cuenta con el apoyo de una diversa gama de inversores que van desde capitalistas de riesgo hasta inversores ángeles dedicados a fomentar la innovación en el sector cripto. El enfoque de estos inversores generalmente se alinea con la misión de SPERO, priorizando proyectos que prometen avances tecnológicos sociales, inclusividad financiera y gobernanza descentralizada. Estas fundaciones de inversores suelen estar interesadas en proyectos que no solo ofrecen productos innovadores, sino que también contribuyen positivamente a la comunidad blockchain y sus ecosistemas. El respaldo de estos inversores refuerza a SPERO,$$s$ como un contendiente notable en el rápidamente evolutivo dominio de los proyectos cripto. ¿Cómo Funciona SPERO,$$s$? SPERO,$$s$ emplea un marco multifacético que lo distingue de los proyectos de criptomonedas convencionales. Aquí hay algunas de las características clave que subrayan su singularidad e innovación: Gobernanza Descentralizada: SPERO,$$s$ integra modelos de gobernanza descentralizada, empoderando a los usuarios para participar activamente en los procesos de toma de decisiones sobre el futuro del proyecto. Este enfoque fomenta un sentido de propiedad y responsabilidad entre los miembros de la comunidad. Utilidad del Token: SPERO,$$s$ utiliza su propio token de criptomoneda, diseñado para servir a diversas funciones dentro del ecosistema. Estos tokens permiten transacciones, recompensas y la facilitación de servicios ofrecidos en la plataforma, mejorando la participación y utilidad general. Arquitectura en Capas: La arquitectura técnica de SPERO,$$s$ soporta la modularidad y escalabilidad, permitiendo la integración fluida de características y aplicaciones adicionales a medida que el proyecto evoluciona. Esta adaptabilidad es fundamental para mantener la relevancia en el siempre cambiante paisaje cripto. Participación de la Comunidad: El proyecto enfatiza iniciativas impulsadas por la comunidad, empleando mecanismos que incentivan la colaboración y la retroalimentación. Al nutrir una comunidad sólida, SPERO,$$s$ puede abordar mejor las necesidades de los usuarios y adaptarse a las tendencias del mercado. Enfoque en la Inclusión: Al ofrecer tarifas de transacción bajas y interfaces amigables para el usuario, SPERO,$$s$ busca atraer a una base de usuarios diversa, incluyendo a individuos que anteriormente pueden no haber participado en el espacio cripto. Este compromiso con la inclusión se alinea con su misión general de empoderamiento a través de la accesibilidad. Cronología de SPERO,$$s$ Entender la historia de un proyecto proporciona información crucial sobre su trayectoria de desarrollo y hitos. A continuación, se presenta una cronología sugerida que mapea eventos significativos en la evolución de SPERO,$$s$: Fase de Conceptualización e Ideación: Las ideas iniciales que forman la base de SPERO,$$s$ fueron concebidas, alineándose estrechamente con los principios de descentralización y enfoque comunitario dentro de la industria blockchain. Lanzamiento del Whitepaper del Proyecto: Tras la fase conceptual, se publicó un whitepaper completo que detalla la visión, objetivos e infraestructura tecnológica de SPERO,$$s$ para generar interés y retroalimentación de la comunidad. Construcción de Comunidad y Primeras Interacciones: Se realizaron esfuerzos de divulgación activa para construir una comunidad de primeros adoptantes e inversores potenciales, facilitando discusiones en torno a los objetivos del proyecto y obteniendo apoyo. Evento de Generación de Tokens: SPERO,$$s$ llevó a cabo un evento de generación de tokens (TGE) para distribuir sus tokens nativos a los primeros seguidores y establecer liquidez inicial dentro del ecosistema. Lanzamiento de la dApp Inicial: La primera aplicación descentralizada (dApp) asociada con SPERO,$$s$ se puso en marcha, permitiendo a los usuarios interactuar con las funcionalidades centrales de la plataforma. Desarrollo Continuo y Alianzas: Actualizaciones y mejoras continuas en las ofertas del proyecto, incluyendo alianzas estratégicas con otros actores en el espacio blockchain, han moldeado a SPERO,$$s$ en un jugador competitivo y en evolución en el mercado cripto. Conclusión SPERO,$$s$ se erige como un testimonio del potencial de web3 y las criptomonedas para revolucionar los sistemas financieros y empoderar a los individuos. Con un compromiso con la gobernanza descentralizada, la participación comunitaria y funcionalidades diseñadas de manera innovadora, allana el camino hacia un paisaje financiero más inclusivo. Como con cualquier inversión en el rápidamente evolutivo espacio cripto, se anima a los potenciales inversores y usuarios a investigar a fondo y participar de manera reflexiva con los desarrollos en curso dentro de SPERO,$$s$. El proyecto muestra el espíritu innovador de la industria cripto, invitando a una exploración más profunda de sus innumerables posibilidades. Aunque el viaje de SPERO,$$s$ aún se está desarrollando, sus principios fundamentales pueden, de hecho, influir en el futuro de cómo interactuamos con la tecnología, las finanzas y entre nosotros en ecosistemas digitales interconectados.

339 Vistas totalesPublicado en 2024.12.17Actualizado en 2024.12.17

Qué es $S$

Qué es AGENT S

Agent S: El Futuro de la Interacción Autónoma en Web3 Introducción En el paisaje en constante evolución de Web3 y las criptomonedas, las innovaciones están redefiniendo continuamente cómo los individuos interactúan con las plataformas digitales. Uno de estos proyectos pioneros, Agent S, promete revolucionar la interacción humano-computadora a través de su marco agente abierto. Al allanar el camino para interacciones autónomas, Agent S tiene como objetivo simplificar tareas complejas, ofreciendo aplicaciones transformadoras en inteligencia artificial (IA). Esta exploración detallada se adentrará en las complejidades del proyecto, sus características únicas y las implicaciones para el dominio de las criptomonedas. ¿Qué es Agent S? Agent S se presenta como un marco agente abierto revolucionario, diseñado específicamente para abordar tres desafíos fundamentales en la automatización de tareas informáticas: Adquisición de Conocimiento Específico del Dominio: El marco aprende de manera inteligente a partir de diversas fuentes de conocimiento externas y experiencias internas. Este enfoque dual le permite construir un rico repositorio de conocimiento específico del dominio, mejorando su rendimiento en la ejecución de tareas. Planificación a Largo Plazo de Tareas: Agent S emplea planificación jerárquica aumentada por la experiencia, un enfoque estratégico que facilita la descomposición y ejecución eficiente de tareas intrincadas. Esta característica mejora significativamente su capacidad para gestionar múltiples subtareas de manera eficiente y efectiva. Manejo de Interfaces Dinámicas y No Uniformes: El proyecto introduce la Interfaz Agente-Computadora (ACI), una solución innovadora que mejora la interacción entre agentes y usuarios. Utilizando Modelos de Lenguaje Multimodal Grandes (MLLMs), Agent S puede navegar y manipular diversas interfaces gráficas de usuario sin problemas. A través de estas características pioneras, Agent S proporciona un marco robusto que aborda las complejidades involucradas en la automatización de la interacción humana con las máquinas, preparando el terreno para innumerables aplicaciones en IA y más allá. ¿Quién es el Creador de Agent S? Aunque el concepto de Agent S es fundamentalmente innovador, la información específica sobre su creador sigue siendo elusiva. El creador es actualmente desconocido, lo que resalta ya sea la etapa incipiente del proyecto o la elección estratégica de mantener a los miembros fundadores en el anonimato. Independientemente de la anonimidad, el enfoque sigue siendo las capacidades y el potencial del marco. ¿Quiénes son los Inversores de Agent S? Dado que Agent S es relativamente nuevo en el ecosistema criptográfico, la información detallada sobre sus inversores y patrocinadores financieros no está documentada explícitamente. La falta de información disponible públicamente sobre las bases de inversión u organizaciones que apoyan el proyecto plantea preguntas sobre su estructura de financiamiento y hoja de ruta de desarrollo. Comprender el respaldo es crucial para evaluar la sostenibilidad del proyecto y su posible impacto en el mercado. ¿Cómo Funciona Agent S? En el núcleo de Agent S se encuentra tecnología de vanguardia que le permite funcionar de manera efectiva en diversos entornos. Su modelo operativo se basa en varias características clave: Interacción Humano-Computadora: El marco ofrece planificación avanzada de IA, esforzándose por hacer que las interacciones con las computadoras sean más intuitivas. Al imitar el comportamiento humano en la ejecución de tareas, promete elevar las experiencias de los usuarios. Memoria Narrativa: Empleada para aprovechar experiencias de alto nivel, Agent S utiliza memoria narrativa para hacer un seguimiento de las historias de tareas, mejorando así sus procesos de toma de decisiones. Memoria Episódica: Esta característica proporciona a los usuarios orientación paso a paso, permitiendo que el marco ofrezca apoyo contextual a medida que se desarrollan las tareas. Soporte para OpenACI: Con la capacidad de funcionar localmente, Agent S permite a los usuarios mantener el control sobre sus interacciones y flujos de trabajo, alineándose con la ética descentralizada de Web3. Fácil Integración con APIs Externas: Su versatilidad y compatibilidad con diversas plataformas de IA aseguran que Agent S pueda integrarse sin problemas en ecosistemas tecnológicos existentes, convirtiéndolo en una opción atractiva para desarrolladores y organizaciones. Estas funcionalidades contribuyen colectivamente a la posición única de Agent S dentro del espacio cripto, ya que automatiza tareas complejas y de múltiples pasos con una intervención humana mínima. A medida que el proyecto evoluciona, sus aplicaciones potenciales en Web3 podrían redefinir cómo se desarrollan las interacciones digitales. Cronología de Agent S El desarrollo y los hitos de Agent S pueden encapsularse en una cronología que destaca sus eventos significativos: 27 de septiembre de 2024: Se lanzó el concepto de Agent S en un documento de investigación integral titulado “Un Marco Agente Abierto que Utiliza Computadoras como un Humano”, mostrando las bases del proyecto. 10 de octubre de 2024: El documento de investigación se hizo disponible públicamente en arXiv, ofreciendo una exploración en profundidad del marco y su evaluación de rendimiento basada en el benchmark OSWorld. 12 de octubre de 2024: Se publicó una presentación en video, proporcionando una visión visual de las capacidades y características de Agent S, involucrando aún más a posibles usuarios e inversores. Estos hitos en la cronología no solo ilustran el progreso de Agent S, sino que también indican su compromiso con la transparencia y el compromiso comunitario. Puntos Clave Sobre Agent S A medida que el marco Agent S continúa evolucionando, varios atributos clave destacan, subrayando su naturaleza innovadora y potencial: Marco Innovador: Diseñado para proporcionar un uso intuitivo de las computadoras similar a la interacción humana, Agent S aporta un enfoque novedoso a la automatización de tareas. Interacción Autónoma: La capacidad de interactuar de manera autónoma con las computadoras a través de GUI significa un avance hacia soluciones informáticas más inteligentes y eficientes. Automatización de Tareas Complejas: Con su metodología robusta, puede automatizar tareas complejas y de múltiples pasos, haciendo que los procesos sean más rápidos y menos propensos a errores. Mejora Continua: Los mecanismos de aprendizaje permiten a Agent S mejorar a partir de experiencias pasadas, mejorando continuamente su rendimiento y eficacia. Versatilidad: Su adaptabilidad en diferentes entornos operativos como OSWorld y WindowsAgentArena asegura que pueda servir a una amplia gama de aplicaciones. A medida que Agent S se posiciona en el paisaje de Web3 y criptomonedas, su potencial para mejorar las capacidades de interacción y automatizar procesos significa un avance significativo en las tecnologías de IA. A través de su marco innovador, Agent S ejemplifica el futuro de las interacciones digitales, prometiendo una experiencia más fluida y eficiente para los usuarios en diversas industrias. Conclusión Agent S representa un audaz avance en la unión de la IA y Web3, con la capacidad de redefinir cómo interactuamos con la tecnología. Aunque aún se encuentra en sus primeras etapas, las posibilidades para su aplicación son vastas y atractivas. A través de su marco integral que aborda desafíos críticos, Agent S tiene como objetivo llevar las interacciones autónomas al primer plano de la experiencia digital. A medida que nos adentramos más en los reinos de las criptomonedas y la descentralización, proyectos como Agent S sin duda desempeñarán un papel crucial en la configuración del futuro de la tecnología y la colaboración humano-computadora.

1.1k Vistas totalesPublicado en 2025.01.14Actualizado en 2025.01.14

Qué es AGENT S

Cómo comprar S

¡Bienvenido a HTX.com! Hemos hecho que comprar Sonic (S) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Sonic (S) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Sonic (S)Después de comprar tu Sonic (S), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Sonic (S)Tradear fácilmente con Sonic (S) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

1.9k Vistas totalesPublicado en 2025.01.15Actualizado en 2026.06.02

Cómo comprar S

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de S (S).

活动图片