Los grandes modelos ya no evalúan la calidad de las imágenes "por intuición", usan diagramas estructurales y espectrogramas como "pruebas materiales" para puntuar con "evidencia visual"
El modelo multimodal grande (MLLM) IQA-T1, desarrollado por la Universidad Politécnica del Noroeste y la Universidad de Ciencia y Tecnología de Hong Kong, introduce un marco innovador para evaluar la calidad de imágenes. En lugar de depender de interpretaciones semánticas subjetivas, el modelo utiliza activamente un conjunto de herramientas de análisis para generar "evidencia visual" estructurada, como mapas de residuos de ruido, espectros de Fourier y mapas de coherencia de orientación de gradientes. Este enfoque basado en evidencias permite una evaluación más precisa y explicable.
El modelo se entrena en dos fases: primero, una fase de ajuste supervisado (SFT) para aprender a utilizar las herramientas, y luego, un aprendizaje por refuerzo (RL) para optimizar cuándo y cómo emplearlas. IQA-T1 demostró un rendimiento superior en siete benchmarks de evaluación de calidad de imágenes, logrando una precisión media de 0.795 en PLCC y 0.784 en SRCC, al tiempo que ofrece cadenas de razonamiento interpretables. Los recursos, incluidos el código, el modelo y el conjunto de datos Q-Tool, están disponibles públicamente.
marsbit07/20 07:51