大模型给图片打分不再“靠嘴说”,结构图、频谱图当“物证”,用“视觉证据”来给图片打分

marsbit发布于2026-07-20更新于2026-07-20

文章摘要

传统多模态大模型在评估图像质量时,常因依赖高层语义理解而忽略底层退化细节,导致打分“凭感觉”而非基于证据。西北工业大学与香港科技大学团队提出新框架IQA-T1,首次让大模型在评估时能主动调用专业分析工具(如生成噪声残差图、傅里叶频谱等),形成结构化“视觉证据”来支持判断。该方法将图像质量评估转化为可解释的证据驱动推理。 IQA-T1通过两阶段训练:监督微调学习工具使用规范,强化学习优化工具调用策略,确保模型用最少、最相关的工具获取足够证据。团队还构建了首个支持证据推理的数据集Q-Tool。在7个基准测试中,IQA-T1取得了综合最优成绩(平均PLCC 0.795/SRCC 0.784),尤其在合成失真和算法退化数据集上表现突出,且其动态调用工具的策略(平均每图仅用2.34个工具)在保证精度的同时提升了效率与可解释性。 该工作表明,引入结构化视觉证据能使多模态推理更可靠、更可追溯,为相关研究提供了新范式。论文、代码、模型与数据均已开源。

让大模型给一张图片打“质量分”,它其实经常看走眼

一张干净的照片,和它偷偷加了噪声、被压过、糊了一点的“退化版”,在你我眼里质量天差地别——但在多模态大模型(MLLM)的“眼睛”里,这两张图几乎长得一模一样

于是它给出的分数,往往是“凭感觉”估的,而不是“看证据”得出的。

现在,来自西北工业大学香港科技大学的研究团队提出了一个新框架——IQA-T1,第一次让多模态大模型在评估图像质量时,学会像专业检测员一样:

不再只靠“瞥一眼”的直觉,而是主动调用一套专业分析工具,生成噪声残差图、梯度分布、傅里叶频谱等结构化的“视觉证据”,再一步步基于证据做出判断。

从“凭感觉打分”到“拿证据说话”——在7个图像质量评估基准上,IQA-T1取得了综合最优(SOTA)的成绩,平均PLCC/SRCC达到0.795/0.784,同时给出的评估过程可解释、可追溯

论文与代码均已开源。

现有MLLM打分要么是“纯文本推理”(易受语义偏见误导),要么是“区域裁剪推理”(一堆没有解释的图像块);IQA-T1则走向“工具生成视觉证据”的新范式。

大模型打质量分,为什么会“凭感觉”?

图像质量评估(Image Quality Assessment, IQA)的目标,是让机器打出的分数尽可能贴近人的主观感受。它是图像修复、增强、压缩等一系列视觉任务的“裁判”,直接决定了视觉系统在真实开放环境中好不好用、稳不稳。

随着多模态大模型崛起,越来越多工作开始用它们的“推理能力”来做IQA,希望既能给出分数,又能讲清楚“为什么是这个分”。听起来很美好,但研究团队指出了一个共性的根本缺陷:

现有MLLM打分,依赖的是带有语义偏见的内部视觉表征,而不是可验证的底层退化证据。

说人话就是:大模型的视觉编码器天生擅长理解“这是一只猫、这是一片海滩”这类高层语义,却对噪声、模糊、压缩伪影这类底层退化极不敏感。

论文里有一个很直观的刻画:给定一张原图

和它加了噪声的退化版

,人类会打出差异巨大的分数,但两者在大模型里的视觉表征却几乎相等——

表征几乎不变,质量却有明显差异。这就是所谓的语义偏见(Semantic Bias):模型手里根本没有足够的信息去感知退化,自然只能“猜”。

现有方法试图打两个补丁,但都没打到点上:

  • 纯文本推理(如Q-Insight、VisualQuality-R1):生成一段结构化的质量描述再打分,但整个推理仍然建立在模型自己“脑补”的语义先验上,缺乏可验证的视觉锚点;
  • 区域裁剪推理(如Zoom-IQA、Q-Probe):把图里可能有问题的区域放大、裁下来喂给模型。可这些区域本质上还是一堆没有结构化解释的图像块,模型看到了也说不清“这块到底是噪声、是模糊还是伪影”。

一句话总结:它们都没能给推理过程提供“证据”。

核心思路:给大模型配一个“检测工具箱”

IQA-T1的解法,可以类比成医生看病的进化:

过去的模型像是只靠“望闻问切”经验下诊断的老中医;而IQA-T1像是学会了主动开CT、验血、拍片的现代医生——先拿到客观的检查结果(证据),再据此下判断。

具体来说,团队为模型准备了一个感知工具库。推理时,模型会自主决定调用其中哪些工具,每个工具专门“显影”一种特定的画质退化,把肉眼(和大模型标准表征)看不见的问题,转成一张张结构化的证据图:

  • NoiseResidualMap(噪声残差图):用原图减去去噪版本,把传感器噪声、压缩噪声单独“抠”出来;
  • FourierMagnitudeSpectrum(傅里叶幅度谱):在频域里揪出周期性伪影;
  • GradientOrientationCoherenceMap(梯度方向一致性图):暴露因模糊、过度平滑造成的结构不一致;

......

这些证据图会被逐步融入推理链,成为模型每一步判断的“物证”。这样一来,IQA就从一个纯靠语义脑补的推理任务,变成了有据可查的证据驱动推理

工具库的设计也很讲究。团队梳理出IQA中7个关键感知属性——结构、锐度、噪声、伪影、亮度、色彩、自然度,并据此设计了15种视觉证据。所有工具还满足三条工程约束:统一调用接口、输出适度下采样(省token)、结果完全确定性(保证数据构建、SFT、RL三个阶段看到的证据完全一致)。

从“会用工具”到“会挑时机”:两阶段训练

要让模型真正掌握这套本领,需要两种能力:知道怎么用工具,以及知道什么时候该用。IQA-T1用一条两阶段训练流水线来解决。

第一阶段:监督微调(SFT)——先学会“怎么用”

在自建的Q-Tool数据集上做监督微调,让模型掌握三件事:遵循结构化的推理模板、使用规范的工具调用语法、把视觉证据和质量判断关联起来。注意,模型不需要自己生成证据图(那是工具确定性产出的),训练时对证据图对应的token做了loss masking。

第二阶段:强化学习(RL)——再学会“何时用”

SFT教会了“怎么用”,但没优化“调用策略”。于是团队用GRPO做强化学习,专门打磨模型自适应调用工具的策略。奖励函数由四部分精心组合:

  • 格式奖励

:输出是否符合规范结构(含工具调用标签和最终分数);

  • 打分奖励

:预测分与真值越接近,奖励越高(指数衰减);

  • 工具使用奖励

:鼓励调用“适量”的工具——太少没证据,太多则惩罚冗余;

  • 重复惩罚

:一旦反复调用同一个工具刷存在感,直接扣分。

四项加权求和(

权重最高,给到5),最终让模型学会用尽量少、尽量对的工具,拿到尽量足的证据

数据集Q-Tool:第一个“证据推理”IQA数据集

现有IQA数据集里,没有一个支持“视觉证据推理”。团队干脆自己造了一个——Q-Tool,包含11k条高质量多模态推理链,每条都把工具生成的视觉证据和人类对齐的文字分析绑在一起。

它通过一条三阶段流水线构建:

  • 工具库构建:

即前文的7属性/15证据工具集;

  • 证据推理链合成:

先由人类专家写好 推理模板 (把画质评估拆成“看结构→分析噪声→评估色彩......”等阶段,并规定属性到工具的映射),再让 GPT-4o 在模板约束下生成完整推理链,避免模型放飞自我地“幻觉”;

  • 推理链验证:

工具是否用对、证据是否真正被引用、结论是否被证据支撑 三个维度逐条审查,不合格的直接删除,边缘case人工精修。

实验结果:7大基准综合SOTA

团队在KonIQ上训练,并在覆盖真实失真、合成失真、算法退化、AI生成内容的7个基准上评测跨分布泛化能力,对手包括传统手工方法、深度学习方法、以及最新的一众MLLM方法。

结果是,IQA-T1拿下了7个数据集平均PLCC 0.795/SRCC 0.784的综合第一:

对比只会打分、不会解释的MLLM方法 (如Q-Align、DeQA) ,IQA-T1在保持高精度的同时,还能给出 可解释、有证据 的推理链;

对比同样带推理的方法 (如Q-Insight、VisualQuality-R1、Zoom-IQA) ,它在 合成失真(CSIQ)和算法退化(PIPAL) 这两个硬骨头数据集上刷新了最好成绩,在真实图像和AI生成内容上也极具竞争力。

一个直观的例子最能说明问题:

更有意思的是关于“工具怎么调”的消融:

也就是说,工具不是用得越多越好——无关工具反而会引入冗余视觉token和干扰。IQA-T1的动态调用平均每张图只用2.34个工具,却拿到了全场最好的效果,还更省时省显存。这说明模型是真的在“基于证据推理”,而不是简单地“拟合分数”。

此外,把框架换到Qwen3-VL-2B、InternVL3.5-4B等不同基座上,性能趋势依旧稳定——证明“工具化视觉证据推理”是一种通用机制,而非某个特定模型的专属技巧。

团队

这项工作由西北工业大学香港科技大学联合完成。论文第一作者为西北工业大学的Jinjian Wu与香港科技大学的Jiaqi Tang(共同一作),通讯作者为西北工业大学的Wei Wei教授与香港科技大学的Qifeng Chen教授。

团队希望这项工作能启发更多研究:把结构化的视觉证据引入多模态推理系统,让大模型的“感知”变得更可靠、更可解释。

论文:https://arxiv.org/abs/2607.12375v1

代码:https://github.com/zibuyu-02/IQA-T1

模型:https://huggingface.co/zibuyu-02/IQA-T1

数据:https://huggingface.co/datasets/zibuyu-02/Q-Tool

Demo:https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

本文来自微信公众号“量子位”,作者:IQA-T1团队

相关问答

QIQA-T1的核心创新是什么?

AIQA-T1的核心创新在于,它首次让多模态大模型在评估图像质量时,从过去依赖‘直觉’或‘感觉’打分,转变为主动调用一套专业的视觉分析工具(如生成噪声残差图、傅里叶频谱图等),生成结构化的‘视觉证据’,并基于这些证据进行可解释、可追溯的推理和打分。

Q为什么传统多模态大模型在图像质量评估时容易‘凭感觉’打分?

A因为传统多模态大模型的视觉编码器主要擅长理解图像的高层语义(如‘猫’、‘海滩’),而对噪声、模糊、压缩伪影等底层视觉退化信息极不敏感。这就导致它看一张清晰的原图和一张严重退化的图片,其内部视觉表征可能非常相似,无法有效区分,因此只能依赖语义偏见进行猜测或‘凭感觉’给出分数。

QIQA-T1框架主要解决了哪两个关键能力,并通过什么训练方式实现的?

AIQA-T1框架主要解决了让模型‘知道怎么使用工具’和‘知道何时使用工具’这两个关键能力。这是通过一条两阶段的训练流水线实现的:第一阶段是监督微调(SFT),让模型学会遵循推理模板、正确调用工具;第二阶段是强化学习(RL),专门优化模型自适应调用工具的策略,使其能用最少、最相关的工具获取充分的证据。

QIQA-T1框架中,强化学习(RL)阶段的奖励函数包含哪几个部分?

AIQA-T1强化学习阶段的奖励函数包含四个部分:1. 格式奖励,确保输出符合规范结构;2. 打分奖励,鼓励预测分数与真实值接近;3. 工具使用奖励,鼓励调用适量(不多不少)的工具;4. 重复惩罚,防止模型重复调用同一个工具。其中打分奖励的权重最高。

QIQA-T1方法在评估结果上取得了什么成绩?与其他方法相比有何优势?

AIQA-T1在覆盖真实失真、合成失真、算法退化、AI生成内容等场景的7个图像质量评估基准上,取得了综合最优(SOTA)的成绩,平均PLCC/SRCC达到0.795/0.784。相较于其他方法,其优势在于:1. 在保持高精度的同时,能提供基于‘视觉证据’的可解释推理过程;2. 在合成失真和算法退化等挑战性数据集上表现尤为出色;3. 能够自适应调用少量关键工具,避免了冗余和干扰。

你可能也喜欢

XRP未平仓合约达26亿美元,衍生品需求激增

XRP期货未平仓合约总额已飙升至26亿美元,24小时内增幅超过10%,使其成为按该指标计算的第四大加密货币资产。 未平仓合约增长表明衍生品市场对XRP的兴趣显著升温,更多资本正在进入。但这本身并不等同于现货买入,可能反映多头、空头、对冲或杠杆投机等多种策略。因此,单纯这一数据无法判断市场看涨或看跌。 XRP衍生品活动激增可能源于对市场结构、ETF相关猜测或瑞波公司动态的预期,但现有信息不支持将此直接解读为机构在积累现货。 高杠杆是一把双刃剑。未平仓合约的增加既能助推价格大幅波动,也可能在市场反转时引发连锁清算,增加市场脆弱性。关键在于后续走势:若价格上涨伴随稳定的衍生品条件,则新增头寸可能被健康吸收;若价格突然逆转,则可能转化为强平压力。 对于看涨者而言,最有力的确认信号将来自现货市场的配合。如果未平仓合约增长的同时,现货交易量、交易所需求和市场广度也同步走强,则更具建设性;反之,若现货需求疲软,则本轮活动可能更偏向投机。 总之,26亿美元的里程碑标志着XRP重新吸引了大量衍生品市场的关注,但并未预示明确方向。下一步的关键是观察这些资本是能支撑起更强劲的趋势,还是仅仅为这个本就活跃的市场增添了更多波动性。

bitcoinist2小时前

XRP未平仓合约达26亿美元,衍生品需求激增

bitcoinist2小时前

交易

现货
活动图片