Los grandes modelos ya no evalúan la calidad de las imágenes "por intuición", usan diagramas estructurales y espectrogramas como "pruebas materiales" para puntuar con "evidencia visual"

marsbitPublicado a 2026-07-20Actualizado a 2026-07-20

Resumen

El modelo multimodal grande (MLLM) IQA-T1, desarrollado por la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong, introduce un marco innovador para evaluar la calidad de imágenes. En lugar de depender de interpretaciones semánticas subjetivas, el modelo utiliza activamente un conjunto de herramientas de análisis para generar "evidencia visual" estructurada, como mapas de residuos de ruido, espectros de Fourier y mapas de coherencia de orientación de gradientes. Este enfoque basado en evidencias permite una evaluación más precisa y explicable. El modelo se entrena en dos fases: primero, una fase de ajuste supervisado (SFT) para aprender a utilizar las herramientas, y luego, un aprendizaje por refuerzo (RL) para optimizar cuándo y cómo emplearlas. IQA-T1 demostró un rendimiento superior en siete benchmarks de evaluación de calidad de imágenes, logrando una precisión media de 0.795 en PLCC y 0.784 en SRCC, al tiempo que ofrece cadenas de razonamiento interpretables. Los recursos, incluidos el código, el modelo y el conjunto de datos Q-Tool, están disponibles públicamente.

Cuando se le pide a un modelo grande que puntúe la "calidad" de una imagen, muchas veces no lo ve bien.

Una foto limpia y una versión "degradada" a la que se le ha añadido ruido de forma subrepticia, se ha comprimido o está ligeramente borrosa son de una calidad radicalmente distinta a nuestros ojos; pero para los "ojos" de un modelo multimodal grande (MLLM), estas dos imágenes son casi idénticas.

Así que la puntuación que da suele ser una estimación "basada en el instinto", no una conclusión extraída "de las pruebas".

Ahora, un equipo de investigación de la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong ha propuesto un nuevo marco, IQA-T1, que por primera vez permite a los modelos multimodales grandes evaluar la calidad de las imágenes aprendiendo a hacerlo como un inspector profesional:

Ya no se basan únicamente en la intuición de una "mirada rápida", sino que activan activamente un conjunto de herramientas de análisis profesional para generar "evidencias visuales" estructuradas como mapas residuales de ruido, distribuciones de gradiente, espectros de Fourier, etc., y luego toman decisiones paso a paso basándose en estas evidencias.

De "puntuación por intuición" a "puntuación basada en pruebas": en 7 benchmarks de evaluación de calidad de imagen, IQA-T1 logró los mejores resultados generales (SOTA), con promedios de PLCC/SRCC de 0,795/0,784, al tiempo que proporciona un proceso de evaluación interpretable y trazable.

El artículo y el código ya están disponibles de forma abierta.

Las puntuaciones de los MLLM existentes son de "razonamiento puramente textual" (fácilmente influenciables por sesgos semánticos) o de "razonamiento por recorte de región" (un montón de bloques de imagen sin explicación); IQA-T1 avanza hacia un nuevo paradigma de "generación de evidencias visuales mediante herramientas".

¿Por qué los modelos grandes puntúan la calidad "por intuición"?

El objetivo de la evaluación de la calidad de la imagen (Image Quality Assessment, IQA) es que la puntuación dada por la máquina se acerque lo más posible a la percepción subjetiva humana. Es el "árbitro" de una serie de tareas visuales como la restauración, mejora y compresión de imágenes, determinando directamente lo útil y fiable que es un sistema visual en entornos reales abiertos.

Con el auge de los modelos multimodales grandes, cada vez más trabajos utilizan su "capacidad de razonamiento" para realizar IQA, con la esperanza de poder dar una puntuación y al mismo tiempo explicar "por qué es esa puntuación". Suena bien, pero el equipo de investigación señala un defecto fundamental común:

La puntuación de los MLLM existentes depende de representaciones visuales internas con sesgos semánticos, no de evidencias verificables de degradación en el nivel bajo.

En términos más sencillos: los codificadores visuales de los modelos grandes están diseñados para comprender conceptos semánticos de alto nivel como "esto es un gato, esto es una playa", pero son extremadamente insensibles a las degradaciones de bajo nivel como el ruido, el desenfoque o los artefactos de compresión.

El artículo presenta una ilustración muy clara: dada una imagen original

y su versión degradada con ruido añadido

, los humanos darían puntuaciones muy diferentes, pero sus representaciones visuales dentro del modelo grande son casi iguales:

la representación es casi igual, pero la calidad es marcadamente diferente. Esto es lo que se llama sesgo semántico (Semantic Bias): el modelo simplemente no tiene suficiente información para percibir la degradación, por lo que naturalmente solo puede "adivinar".

Los métodos existentes intentan aplicar dos parches, pero ninguno da en el clavo:

  • Razonamiento puramente textual (como Q-Insight, VisualQuality-R1): generan una descripción estructurada de la calidad y luego puntúan, pero todo el razonamiento sigue basándose en la información previa semántica "inventada" por el modelo, careciendo de puntos de anclaje visual verificables;
  • Razonamiento por recorte de región (como Zoom-IQA, Q-Probe): amplían y recortan las áreas potencialmente problemáticas de la imagen para dárselas al modelo. Pero estas áreas son esencialmente un montón de bloques de imagen sin una explicación estructurada; el modelo puede verlas, pero no puede explicar claramente "si este bloque es ruido, desenfoque o un artefacto".

En resumen: ninguno proporciona "evidencia" para el proceso de razonamiento.

Idea central: Proporcionar al modelo grande una "caja de herramientas de detección"

La solución de IQA-T1 se puede comparar con la evolución de cómo diagnostica un médico:

Los modelos anteriores eran como médicos de la medicina tradicional china que diagnostican basándose solo en la experiencia de "observación, olfateo, preguntas y palpación"; mientras que IQA-T1 es como un médico moderno que ha aprendido a pedir activamente tomografías, análisis de sangre y radiografías: primero obtiene resultados de exámenes objetivos (evidencias), y luego diagnostica en base a ellos.

En concreto, el equipo preparó una caja de herramientas de percepción para el modelo. Durante el razonamiento, el modelo decide autónomamente qué herramientas de esta caja llamar. Cada herramienta está especializada en "revelar" un tipo específico de degradación de la calidad de la imagen, convirtiendo problemas invisibles para el ojo humano (y para la representación estándar del modelo grande) en imágenes de evidencia estructurada:

  • NoiseResidualMap (mapa residual de ruido): resta la versión sin ruido de la imagen original, "extrayendo" por separado el ruido del sensor o de la compresión;
  • FourierMagnitudeSpectrum (espectro de magnitud de Fourier): detecta artefactos periódicos en el dominio de la frecuencia;
  • GradientOrientationCoherenceMap (mapa de coherencia de orientación del gradiente): expone las inconsistencias estructurales causadas por el desenfoque o el suavizado excesivo;

......

Estas imágenes de evidencia se integran gradualmente en la cadena de razonamiento, convirtiéndose en las "pruebas materiales" para cada paso del juicio del modelo. De este modo, la IQA deja de ser una tarea de razonamiento basada puramente en la especulación semántica para convertirse en un razonamiento basado en evidencias y verificable.

El diseño de la caja de herramientas también es muy cuidadoso. El equipo identificó 7 atributos de percepción clave en IQA: estructura, nitidez, ruido, artefactos, brillo, color y naturalidad, y en base a ello diseñó 15 tipos de evidencias visuales. Todas las herramientas también cumplen con tres restricciones de ingeniería: interfaz de llamada unificada, salida con submuestreo moderado (para ahorrar tokens) y resultados completamente deterministas (garantizando que la evidencia vista sea completamente consistente en las tres fases: construcción de datos, SFT y RL).

De "saber usar herramientas" a "saber cuándo usarlas": Entrenamiento en dos fases

Para que el modelo domine realmente esta capacidad, necesita dos habilidades: saber cómo usar las herramientas y saber cuándo debe usarlas. IQA-T1 utiliza una canalización de entrenamiento en dos fases para resolverlo.

Primera fase: Ajuste fino supervisado (SFT) — Aprender primero "cómo usar"

Se realiza un ajuste fino supervisado en el conjunto de datos propio Q-Tool, para que el modelo domine tres aspectos: seguir una plantilla de razonamiento estructurado, utilizar una sintaxis de llamada a herramientas estandarizada y relacionar las evidencias visuales con el juicio de calidad. Nótese que el modelo no necesita generar por sí mismo las imágenes de evidencia (éstas son producidas de forma determinista por las herramientas); durante el entrenamiento, se aplicó un enmascaramiento de pérdida (loss masking) a los tokens correspondientes a las imágenes de evidencia.

Segunda fase: Aprendizaje por refuerzo (RL) — Aprender luego "cuándo usar"

El SFT enseñó "cómo usar", pero no optimizó la "estrategia de llamada". Por lo tanto, el equipo utilizó GRPO para el aprendizaje por refuerzo, afinando específicamente la estrategia del modelo para llamar a las herramientas de forma adaptativa. La función de recompensa se compone cuidadosamente de cuatro partes:

  • Recompensa de formato

: si la salida cumple con la estructura normativa (incluye etiquetas de llamada a herramientas y la puntuación final);

  • Recompensa de puntuación

: cuanto más se acerque la puntuación predicha al valor real, mayor será la recompensa (decaimiento exponencial);

  • Recompensa por uso de herramientas

: fomenta llamar a una cantidad "apropiada" de herramientas — demasiado pocas carecen de evidencia, demasiadas reciben penalización por redundancia;

  • Penalización por repetición

: si llama repetidamente a la misma herramienta solo para ganar presencia, se penaliza directamente.

Se suma la ponderación de los cuatro factores (el peso de es el más alto, asignándole 5), logrando finalmente que el modelo aprenda a utilizar el menor número posible de herramientas correctas para obtener suficientes evidencias.

Conjunto de datos Q-Tool: El primer conjunto de datos IQA de "razonamiento basado en evidencias"

Entre los conjuntos de datos IQA existentes, ninguno admite el "razonamiento basado en evidencias visuales". El equipo decidió crear uno propio: Q-Tool, que contiene 11k cadenas de razonamiento multimodal de alta calidad, cada una de las cuales vincula las evidencias visuales generadas por las herramientas con un análisis textual alineado con el juicio humano.

Se construye mediante una canalización de tres etapas:

  • Construcción de la caja de herramientas:

el conjunto de herramientas de 7 atributos/15 evidencias mencionado anteriormente;

  • Síntesis de la cadena de razonamiento basada en evidencias:

primero, los expertos humanos escriben una plantilla de razonamiento (descomponiendo la evaluación de la calidad en etapas como "observar la estructura → analizar el ruido → evaluar el color...", y definiendo el mapeo de atributos a herramientas), luego se hace que GPT-4o genere la cadena de razonamiento completa bajo las restricciones de la plantilla, evitando que el modelo "alucine" libremente;

  • Validación de la cadena de razonamiento:

revisión una por una desde tres dimensiones: si las herramientas se usan correctamente, si la evidencia se cita realmente, si la conclusión está respaldada por la evidencia. Las que no cumplen se eliminan directamente y los casos límite se revisan y ajustan manualmente.

Resultados experimentales: SOTA general en 7 benchmarks

El equipo entrenó en KonIQ y evaluó la capacidad de generalización entre distribuciones en 7 benchmarks que cubren distorsión real, distorsión sintética, degradación algorítmica y contenido generado por IA, comparando con métodos tradicionales manuales, métodos de aprendizaje profundo y los últimos métodos MLLM.

El resultado es que IQA-T1 obtuvo el primer puesto general, con un promedio PLCC de 0,795 y SRCC de 0,784 en los 7 conjuntos de datos:

En comparación con los métodos MLLM que solo pueden puntuar, pero no explicar (como Q-Align, DeQA), IQA-T1 mantiene una alta precisión al tiempo que proporciona una cadena de razonamiento interpretable y basada en evidencias;

En comparación con métodos que también incluyen razonamiento (como Q-Insight, VisualQuality-R1, Zoom-IQA), logró los mejores resultados hasta la fecha en los dos conjuntos de datos más difíciles: distorsión sintética (CSIQ) y degradación algorítmica (PIPAL), y también es muy competitivo en imágenes reales y contenido generado por IA.

Un ejemplo visual lo demuestra claramente:

Lo más interesante son los análisis de ablación sobre "cómo llamar a las herramientas":

Es decir, no es mejor usar más herramientas — las herramientas irrelevantes pueden incluso introducir tokens visuales redundantes e interferencias. La llamada dinámica de IQA-T1 utiliza en promedio solo 2,34 herramientas por imagen, logrando el mejor efecto general, además de ahorrar tiempo y memoria. Esto demuestra que el modelo realmente está "razonando basándose en evidencias", no simplemente "ajustando una puntuación".

Además, al aplicar el marco a diferentes modelos base como Qwen3-VL-2B o InternVL3.5-4B, la tendencia de rendimiento sigue siendo estable, lo que demuestra que el "razonamiento basado en evidencias visuales mediante herramientas" es un mecanismo general, no una habilidad exclusiva de un modelo específico.

Equipo

Este trabajo fue realizado conjuntamente por la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong. Los primeros autores del artículo son Jinjian Wu de la Universidad Politécnica del Noroeste y Jiaqi Tang de la Universidad de Ciencia y Tecnología de Hong Kong (autores principales conjuntos). Los autores de correspondencia son el profesor Wei Wei de la Universidad Politécnica del Noroeste y el profesor Qifeng Chen de la Universidad de Ciencia y Tecnología de Hong Kong.

El equipo espera que este trabajo inspire más investigación: introducir evidencias visuales estructuradas en los sistemas de razonamiento multimodal, haciendo que la "percepción" de los modelos grandes sea más fiable e interpretable.

Artículo: https://arxiv.org/abs/2607.12375v1

Código: https://github.com/zibuyu-02/IQA-T1

Modelo: https://huggingface.co/zibuyu-02/IQA-T1

Datos: https://huggingface.co/datasets/zibuyu-02/Q-Tool

Demo: https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

Este artículo procede de la cuenta oficial de WeChat "Quantum Bits", autor: Equipo IQA-T1

Preguntas relacionadas

Q¿Cuál es el nombre del nuevo marco propuesto para que los modelos multimodales grandes evalúen la calidad de las imágenes de manera más precisa y explicable?

AEl marco propuesto se llama IQA-T1.

Q¿Cuál es el principal defecto de los modelos multimodales grandes (MLLM) existentes al evaluar la calidad de las imágenes según el artículo?

AEl defecto principal es que dependen de representaciones visuales internas con sesgo semántico, en lugar de evidencias verificables de degradación a nivel bajo.

Q¿Qué herramienta específica menciona el artículo para visualizar el ruido en una imagen como evidencia estructural?

ASe menciona la herramienta Noise Residual Map (Mapa de Residuos de Ruido).

Q¿Cuántas etapas de entrenamiento utiliza IQA-T1 y cuál es el objetivo principal de cada una?

AUtiliza dos etapas: 1) Ajuste supervisado (SFT) para aprender a usar las herramientas correctamente, y 2) Aprendizaje por refuerzo (RL) para optimizar la estrategia de cuándo llamar a cada herramienta.

Q¿En cuántos benchmarks de evaluación de calidad de imagen demostró IQA-T1 obtener el mejor rendimiento promedio (SOTA) según los resultados presentados?

AIQA-T1 demostró obtener el mejor rendimiento promedio (SOTA) en 7 benchmarks de evaluación de calidad de imagen.

Lecturas Relacionadas

Cómo identificar una estafa criptográfica o un "rug pull"?

Imagina descubrir un nuevo token prometedor con miles de titulares, precios al alza y una comunidad activa. Todo parece legítimo hasta que la liquidez desaparece de repente. Así comienza un "rug pull". Los desarrolladores primero generan confianza mediante liquidez bloqueada y contratos renunciados. Luego crean expectación en redes sociales. El proceso suele durar 48-72 horas, desde la creación del hype hasta la salida. Los "hard rug pulls" drenan la liquidez de golpe, mientras que los "soft rugs" erosionan el valor lentamente mediante ventas internas o roadmaps abandonados. **Patrones comunes:** * **Concentración elevada:** Que las 5-10 mayores carteras controlen >30% de la oferta aumenta el riesgo. * **Contratos de riesgo:** Funciones de acuñación ocultas, contratos actualizables o restricciones de venta dan control excesivo a los desarrolladores. * **Comportamiento de mercado:** Apreciación rápida del precio impulsada por influencers, volumen orgánico bajo y crecimiento lento de titulares antes de grandes transferencias. **Explotaciones más frecuentes:** 1. **Honeypots (98.442 casos):** Permiten comprar pero bloquean o restringen la venta, atrapando los fondos. 2. **Funciones de acuñación ocultas (60.985 casos):** Inflan la oferta tras el lanzamiento. 3. **Renuncias de propiedad falsas (48.974 casos):** Se afirma descentralización mientras se mantiene el control. La clave para identificarlos es la convergencia de señales on-chain, de contrato y de comportamiento, no una métrica aislada. La transparencia en la distribución, los contratos verificados y las auditorías externas reducen drásticamente el riesgo.

ambcryptoHace 46 min(s)

Cómo identificar una estafa criptográfica o un "rug pull"?

ambcryptoHace 46 min(s)

Predicción del precio de Bitcoin para 2030: Esto es lo que debes saber sobre el próximo mercado alcista

Recientemente, AMBCrypto reportó que los mineros de Bitcoin [BTC] enfrentaban dificultades, con datos que coinciden con condiciones históricas de mercado bajista. Bitcoin ha estado en tendencia bajista desde la caída del 10 de octubre de 2025. No está claro cuándo llegará el mínimo del mercado, pero existen criterios clave a observar. Para impulsar una tendencia alcista, se necesitan entradas significativas de stablecoins a los exchanges, un patrón visto anteriormente en abril de 2021. Actualmente, los flujos netos mensuales son negativos, y un cambio a positivo señalaría un giro en el sentimiento. Joao Wedson, fundador de Alphractal, sugirió, basándose en simetrías históricas, que el fondo de este ciclo podría ubicarse entre $41.5k y $45k en la primera mitad de octubre de 2026. Mirando hacia la predicción del precio para 2030, la adopción institucional podría acelerarse. Un análisis técnico, utilizando niveles de retroceso y extensión de Fibonacci, sugiere que, si se repite un escenario similar al ciclo anterior, Bitcoin podría retroceder hasta alrededor de $39.1k antes de impulsarse más allá del nivel de extensión del 61.8% en $152.3k. Se podría alcanzar un máximo en el rango de $200k-$220k para 2030, antes de que Bitcoin entre en su próximo ciclo bajista. Se advierte que este ciclo podría tomar más tiempo en completarse.

ambcryptoHace 2 hora(s)

Predicción del precio de Bitcoin para 2030: Esto es lo que debes saber sobre el próximo mercado alcista

ambcryptoHace 2 hora(s)

Pulso del Mercado de BTC: Semana 30

Tras rebotar desde niveles inferiores a 58.000 dólares y probar brevemente los 65.000, Bitcoin se ha estabilizado alrededor de los 64.500 dólares. El impulso alcista se ha enfriado y el volumen spot se mantiene moderado. Aunque la recuperación se sostiene, la menor velocidad a corto plazo sugiere que el mercado aún busca un equilibrio más firme. Las primas de volatilidad se han comprimido, lo que indica que los mercados de derivados ya no están precificando un alto premio por riesgo, reflejando una mejora en el sentimiento. Pese a la participación limitada en el mercado spot, el apetito especulativo regresa gradualmente. El interés abierto en futuros y opciones ha aumentado, y el flujo de operadores en perpetuas ha pasado a una posición de compra neta. La demanda de protección a la baja ha disminuido. Los pagos de financiación más bajos en posiciones largas sugieren que la exposición se reconstruye con más cautela, sin el apalancamiento agresivo típico de condiciones sobrecalentadas. La actividad on-chain también se estabiliza, con mejoras modestas en el rendimiento económico y la participación. Los flujos de capital siguen siendo cautelosos, lo que se refleja en la contracción de la capitalización realizada mensual. Sin embargo, la recuperación de los flujos de los ETF spot en EE.UU. y el hecho de que las carteras de ETF se acerquen nuevamente al punto de equilibrio sugieren que la presión de venta institucional se está desvaneciendo. En general, el mercado parece cada vez más equilibrado, con una fuerte rentabilidad de los inversores y posiciones en derivados estables que brindan soporte. No obstante, la creciente proporción de capital a corto plazo y sensible a los precios aumenta la probabilidad de una volatilidad más marcada, dejando al mercado resiliente pero cada vez más sensible a los cambios en el impulso y la presión de venta.

insights.glassnodeHace 4 hora(s)

Pulso del Mercado de BTC: Semana 30

insights.glassnodeHace 4 hora(s)

Trading

Spot
活动图片