Cuando se le pide a un modelo grande que puntúe la "calidad" de una imagen, muchas veces no lo ve bien.
Una foto limpia y una versión "degradada" a la que se le ha añadido ruido de forma subrepticia, se ha comprimido o está ligeramente borrosa son de una calidad radicalmente distinta a nuestros ojos; pero para los "ojos" de un modelo multimodal grande (MLLM), estas dos imágenes son casi idénticas.
Así que la puntuación que da suele ser una estimación "basada en el instinto", no una conclusión extraída "de las pruebas".

Ahora, un equipo de investigación de la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong ha propuesto un nuevo marco, IQA-T1, que por primera vez permite a los modelos multimodales grandes evaluar la calidad de las imágenes aprendiendo a hacerlo como un inspector profesional:
Ya no se basan únicamente en la intuición de una "mirada rápida", sino que activan activamente un conjunto de herramientas de análisis profesional para generar "evidencias visuales" estructuradas como mapas residuales de ruido, distribuciones de gradiente, espectros de Fourier, etc., y luego toman decisiones paso a paso basándose en estas evidencias.
De "puntuación por intuición" a "puntuación basada en pruebas": en 7 benchmarks de evaluación de calidad de imagen, IQA-T1 logró los mejores resultados generales (SOTA), con promedios de PLCC/SRCC de 0,795/0,784, al tiempo que proporciona un proceso de evaluación interpretable y trazable.
El artículo y el código ya están disponibles de forma abierta.

△ Las puntuaciones de los MLLM existentes son de "razonamiento puramente textual" (fácilmente influenciables por sesgos semánticos) o de "razonamiento por recorte de región" (un montón de bloques de imagen sin explicación); IQA-T1 avanza hacia un nuevo paradigma de "generación de evidencias visuales mediante herramientas".
¿Por qué los modelos grandes puntúan la calidad "por intuición"?
El objetivo de la evaluación de la calidad de la imagen (Image Quality Assessment, IQA) es que la puntuación dada por la máquina se acerque lo más posible a la percepción subjetiva humana. Es el "árbitro" de una serie de tareas visuales como la restauración, mejora y compresión de imágenes, determinando directamente lo útil y fiable que es un sistema visual en entornos reales abiertos.
Con el auge de los modelos multimodales grandes, cada vez más trabajos utilizan su "capacidad de razonamiento" para realizar IQA, con la esperanza de poder dar una puntuación y al mismo tiempo explicar "por qué es esa puntuación". Suena bien, pero el equipo de investigación señala un defecto fundamental común:
La puntuación de los MLLM existentes depende de representaciones visuales internas con sesgos semánticos, no de evidencias verificables de degradación en el nivel bajo.
En términos más sencillos: los codificadores visuales de los modelos grandes están diseñados para comprender conceptos semánticos de alto nivel como "esto es un gato, esto es una playa", pero son extremadamente insensibles a las degradaciones de bajo nivel como el ruido, el desenfoque o los artefactos de compresión.
El artículo presenta una ilustración muy clara: dada una imagen original

y su versión degradada con ruido añadido

, los humanos darían puntuaciones muy diferentes, pero sus representaciones visuales dentro del modelo grande son casi iguales:

la representación es casi igual, pero la calidad es marcadamente diferente. Esto es lo que se llama sesgo semántico (Semantic Bias): el modelo simplemente no tiene suficiente información para percibir la degradación, por lo que naturalmente solo puede "adivinar".
Los métodos existentes intentan aplicar dos parches, pero ninguno da en el clavo:
- Razonamiento puramente textual (como Q-Insight, VisualQuality-R1): generan una descripción estructurada de la calidad y luego puntúan, pero todo el razonamiento sigue basándose en la información previa semántica "inventada" por el modelo, careciendo de puntos de anclaje visual verificables;
- Razonamiento por recorte de región (como Zoom-IQA, Q-Probe): amplían y recortan las áreas potencialmente problemáticas de la imagen para dárselas al modelo. Pero estas áreas son esencialmente un montón de bloques de imagen sin una explicación estructurada; el modelo puede verlas, pero no puede explicar claramente "si este bloque es ruido, desenfoque o un artefacto".
En resumen: ninguno proporciona "evidencia" para el proceso de razonamiento.
Idea central: Proporcionar al modelo grande una "caja de herramientas de detección"
La solución de IQA-T1 se puede comparar con la evolución de cómo diagnostica un médico:
Los modelos anteriores eran como médicos de la medicina tradicional china que diagnostican basándose solo en la experiencia de "observación, olfateo, preguntas y palpación"; mientras que IQA-T1 es como un médico moderno que ha aprendido a pedir activamente tomografías, análisis de sangre y radiografías: primero obtiene resultados de exámenes objetivos (evidencias), y luego diagnostica en base a ellos.
En concreto, el equipo preparó una caja de herramientas de percepción para el modelo. Durante el razonamiento, el modelo decide autónomamente qué herramientas de esta caja llamar. Cada herramienta está especializada en "revelar" un tipo específico de degradación de la calidad de la imagen, convirtiendo problemas invisibles para el ojo humano (y para la representación estándar del modelo grande) en imágenes de evidencia estructurada:
- NoiseResidualMap (mapa residual de ruido): resta la versión sin ruido de la imagen original, "extrayendo" por separado el ruido del sensor o de la compresión;
- FourierMagnitudeSpectrum (espectro de magnitud de Fourier): detecta artefactos periódicos en el dominio de la frecuencia;
- GradientOrientationCoherenceMap (mapa de coherencia de orientación del gradiente): expone las inconsistencias estructurales causadas por el desenfoque o el suavizado excesivo;
......
Estas imágenes de evidencia se integran gradualmente en la cadena de razonamiento, convirtiéndose en las "pruebas materiales" para cada paso del juicio del modelo. De este modo, la IQA deja de ser una tarea de razonamiento basada puramente en la especulación semántica para convertirse en un razonamiento basado en evidencias y verificable.
El diseño de la caja de herramientas también es muy cuidadoso. El equipo identificó 7 atributos de percepción clave en IQA: estructura, nitidez, ruido, artefactos, brillo, color y naturalidad, y en base a ello diseñó 15 tipos de evidencias visuales. Todas las herramientas también cumplen con tres restricciones de ingeniería: interfaz de llamada unificada, salida con submuestreo moderado (para ahorrar tokens) y resultados completamente deterministas (garantizando que la evidencia vista sea completamente consistente en las tres fases: construcción de datos, SFT y RL).
De "saber usar herramientas" a "saber cuándo usarlas": Entrenamiento en dos fases
Para que el modelo domine realmente esta capacidad, necesita dos habilidades: saber cómo usar las herramientas y saber cuándo debe usarlas. IQA-T1 utiliza una canalización de entrenamiento en dos fases para resolverlo.

△
Primera fase: Ajuste fino supervisado (SFT) — Aprender primero "cómo usar"
Se realiza un ajuste fino supervisado en el conjunto de datos propio Q-Tool, para que el modelo domine tres aspectos: seguir una plantilla de razonamiento estructurado, utilizar una sintaxis de llamada a herramientas estandarizada y relacionar las evidencias visuales con el juicio de calidad. Nótese que el modelo no necesita generar por sí mismo las imágenes de evidencia (éstas son producidas de forma determinista por las herramientas); durante el entrenamiento, se aplicó un enmascaramiento de pérdida (loss masking) a los tokens correspondientes a las imágenes de evidencia.
Segunda fase: Aprendizaje por refuerzo (RL) — Aprender luego "cuándo usar"
El SFT enseñó "cómo usar", pero no optimizó la "estrategia de llamada". Por lo tanto, el equipo utilizó GRPO para el aprendizaje por refuerzo, afinando específicamente la estrategia del modelo para llamar a las herramientas de forma adaptativa. La función de recompensa se compone cuidadosamente de cuatro partes:
- Recompensa de formato

: si la salida cumple con la estructura normativa (incluye etiquetas de llamada a herramientas y la puntuación final);
- Recompensa de puntuación

: cuanto más se acerque la puntuación predicha al valor real, mayor será la recompensa (decaimiento exponencial);
- Recompensa por uso de herramientas

: fomenta llamar a una cantidad "apropiada" de herramientas — demasiado pocas carecen de evidencia, demasiadas reciben penalización por redundancia;
- Penalización por repetición

: si llama repetidamente a la misma herramienta solo para ganar presencia, se penaliza directamente.
Se suma la ponderación de los cuatro factores (el peso de
es el más alto, asignándole 5), logrando finalmente que el modelo aprenda a utilizar el menor número posible de herramientas correctas para obtener suficientes evidencias.
Conjunto de datos Q-Tool: El primer conjunto de datos IQA de "razonamiento basado en evidencias"
Entre los conjuntos de datos IQA existentes, ninguno admite el "razonamiento basado en evidencias visuales". El equipo decidió crear uno propio: Q-Tool, que contiene 11k cadenas de razonamiento multimodal de alta calidad, cada una de las cuales vincula las evidencias visuales generadas por las herramientas con un análisis textual alineado con el juicio humano.

△
Se construye mediante una canalización de tres etapas:
- Construcción de la caja de herramientas:
el conjunto de herramientas de 7 atributos/15 evidencias mencionado anteriormente;
- Síntesis de la cadena de razonamiento basada en evidencias:
primero, los expertos humanos escriben una plantilla de razonamiento (descomponiendo la evaluación de la calidad en etapas como "observar la estructura → analizar el ruido → evaluar el color...", y definiendo el mapeo de atributos a herramientas), luego se hace que GPT-4o genere la cadena de razonamiento completa bajo las restricciones de la plantilla, evitando que el modelo "alucine" libremente;
- Validación de la cadena de razonamiento:
revisión una por una desde tres dimensiones: si las herramientas se usan correctamente, si la evidencia se cita realmente, si la conclusión está respaldada por la evidencia. Las que no cumplen se eliminan directamente y los casos límite se revisan y ajustan manualmente.
Resultados experimentales: SOTA general en 7 benchmarks
El equipo entrenó en KonIQ y evaluó la capacidad de generalización entre distribuciones en 7 benchmarks que cubren distorsión real, distorsión sintética, degradación algorítmica y contenido generado por IA, comparando con métodos tradicionales manuales, métodos de aprendizaje profundo y los últimos métodos MLLM.
El resultado es que IQA-T1 obtuvo el primer puesto general, con un promedio PLCC de 0,795 y SRCC de 0,784 en los 7 conjuntos de datos:
En comparación con los métodos MLLM que solo pueden puntuar, pero no explicar (como Q-Align, DeQA), IQA-T1 mantiene una alta precisión al tiempo que proporciona una cadena de razonamiento interpretable y basada en evidencias;
En comparación con métodos que también incluyen razonamiento (como Q-Insight, VisualQuality-R1, Zoom-IQA), logró los mejores resultados hasta la fecha en los dos conjuntos de datos más difíciles: distorsión sintética (CSIQ) y degradación algorítmica (PIPAL), y también es muy competitivo en imágenes reales y contenido generado por IA.
Un ejemplo visual lo demuestra claramente:

△
Lo más interesante son los análisis de ablación sobre "cómo llamar a las herramientas":

Es decir, no es mejor usar más herramientas — las herramientas irrelevantes pueden incluso introducir tokens visuales redundantes e interferencias. La llamada dinámica de IQA-T1 utiliza en promedio solo 2,34 herramientas por imagen, logrando el mejor efecto general, además de ahorrar tiempo y memoria. Esto demuestra que el modelo realmente está "razonando basándose en evidencias", no simplemente "ajustando una puntuación".

△
Además, al aplicar el marco a diferentes modelos base como Qwen3-VL-2B o InternVL3.5-4B, la tendencia de rendimiento sigue siendo estable, lo que demuestra que el "razonamiento basado en evidencias visuales mediante herramientas" es un mecanismo general, no una habilidad exclusiva de un modelo específico.
Equipo
Este trabajo fue realizado conjuntamente por la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong. Los primeros autores del artículo son Jinjian Wu de la Universidad Politécnica del Noroeste y Jiaqi Tang de la Universidad de Ciencia y Tecnología de Hong Kong (autores principales conjuntos). Los autores de correspondencia son el profesor Wei Wei de la Universidad Politécnica del Noroeste y el profesor Qifeng Chen de la Universidad de Ciencia y Tecnología de Hong Kong.
El equipo espera que este trabajo inspire más investigación: introducir evidencias visuales estructuradas en los sistemas de razonamiento multimodal, haciendo que la "percepción" de los modelos grandes sea más fiable e interpretable.
Artículo: https://arxiv.org/abs/2607.12375v1
Código: https://github.com/zibuyu-02/IQA-T1
Modelo: https://huggingface.co/zibuyu-02/IQA-T1
Datos: https://huggingface.co/datasets/zibuyu-02/Q-Tool
Demo: https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1
Este artículo procede de la cuenta oficial de WeChat "Quantum Bits", autor: Equipo IQA-T1





