大模型给图片打分不再“靠嘴说”,结构图、频谱图当“物证”,用“视觉证据”来给图片打分

marsbit發佈於 2026-07-20更新於 2026-07-20

文章摘要

传统多模态大模型在评估图像质量时,常因依赖高层语义理解而忽略底层退化细节,导致打分“凭感觉”而非基于证据。西北工业大学与香港科技大学团队提出新框架IQA-T1,首次让大模型在评估时能主动调用专业分析工具(如生成噪声残差图、傅里叶频谱等),形成结构化“视觉证据”来支持判断。该方法将图像质量评估转化为可解释的证据驱动推理。 IQA-T1通过两阶段训练:监督微调学习工具使用规范,强化学习优化工具调用策略,确保模型用最少、最相关的工具获取足够证据。团队还构建了首个支持证据推理的数据集Q-Tool。在7个基准测试中,IQA-T1取得了综合最优成绩(平均PLCC 0.795/SRCC 0.784),尤其在合成失真和算法退化数据集上表现突出,且其动态调用工具的策略(平均每图仅用2.34个工具)在保证精度的同时提升了效率与可解释性。 该工作表明,引入结构化视觉证据能使多模态推理更可靠、更可追溯,为相关研究提供了新范式。论文、代码、模型与数据均已开源。

让大模型给一张图片打“质量分”,它其实经常看走眼

一张干净的照片,和它偷偷加了噪声、被压过、糊了一点的“退化版”,在你我眼里质量天差地别——但在多模态大模型(MLLM)的“眼睛”里,这两张图几乎长得一模一样

于是它给出的分数,往往是“凭感觉”估的,而不是“看证据”得出的。

现在,来自西北工业大学香港科技大学的研究团队提出了一个新框架——IQA-T1,第一次让多模态大模型在评估图像质量时,学会像专业检测员一样:

不再只靠“瞥一眼”的直觉,而是主动调用一套专业分析工具,生成噪声残差图、梯度分布、傅里叶频谱等结构化的“视觉证据”,再一步步基于证据做出判断。

从“凭感觉打分”到“拿证据说话”——在7个图像质量评估基准上,IQA-T1取得了综合最优(SOTA)的成绩,平均PLCC/SRCC达到0.795/0.784,同时给出的评估过程可解释、可追溯

论文与代码均已开源。

现有MLLM打分要么是“纯文本推理”(易受语义偏见误导),要么是“区域裁剪推理”(一堆没有解释的图像块);IQA-T1则走向“工具生成视觉证据”的新范式。

大模型打质量分,为什么会“凭感觉”?

图像质量评估(Image Quality Assessment, IQA)的目标,是让机器打出的分数尽可能贴近人的主观感受。它是图像修复、增强、压缩等一系列视觉任务的“裁判”,直接决定了视觉系统在真实开放环境中好不好用、稳不稳。

随着多模态大模型崛起,越来越多工作开始用它们的“推理能力”来做IQA,希望既能给出分数,又能讲清楚“为什么是这个分”。听起来很美好,但研究团队指出了一个共性的根本缺陷:

现有MLLM打分,依赖的是带有语义偏见的内部视觉表征,而不是可验证的底层退化证据。

说人话就是:大模型的视觉编码器天生擅长理解“这是一只猫、这是一片海滩”这类高层语义,却对噪声、模糊、压缩伪影这类底层退化极不敏感。

论文里有一个很直观的刻画:给定一张原图

和它加了噪声的退化版

,人类会打出差异巨大的分数,但两者在大模型里的视觉表征却几乎相等——

表征几乎不变,质量却有明显差异。这就是所谓的语义偏见(Semantic Bias):模型手里根本没有足够的信息去感知退化,自然只能“猜”。

现有方法试图打两个补丁,但都没打到点上:

  • 纯文本推理(如Q-Insight、VisualQuality-R1):生成一段结构化的质量描述再打分,但整个推理仍然建立在模型自己“脑补”的语义先验上,缺乏可验证的视觉锚点;
  • 区域裁剪推理(如Zoom-IQA、Q-Probe):把图里可能有问题的区域放大、裁下来喂给模型。可这些区域本质上还是一堆没有结构化解释的图像块,模型看到了也说不清“这块到底是噪声、是模糊还是伪影”。

一句话总结:它们都没能给推理过程提供“证据”。

核心思路:给大模型配一个“检测工具箱”

IQA-T1的解法,可以类比成医生看病的进化:

过去的模型像是只靠“望闻问切”经验下诊断的老中医;而IQA-T1像是学会了主动开CT、验血、拍片的现代医生——先拿到客观的检查结果(证据),再据此下判断。

具体来说,团队为模型准备了一个感知工具库。推理时,模型会自主决定调用其中哪些工具,每个工具专门“显影”一种特定的画质退化,把肉眼(和大模型标准表征)看不见的问题,转成一张张结构化的证据图:

  • NoiseResidualMap(噪声残差图):用原图减去去噪版本,把传感器噪声、压缩噪声单独“抠”出来;
  • FourierMagnitudeSpectrum(傅里叶幅度谱):在频域里揪出周期性伪影;
  • GradientOrientationCoherenceMap(梯度方向一致性图):暴露因模糊、过度平滑造成的结构不一致;

......

这些证据图会被逐步融入推理链,成为模型每一步判断的“物证”。这样一来,IQA就从一个纯靠语义脑补的推理任务,变成了有据可查的证据驱动推理

工具库的设计也很讲究。团队梳理出IQA中7个关键感知属性——结构、锐度、噪声、伪影、亮度、色彩、自然度,并据此设计了15种视觉证据。所有工具还满足三条工程约束:统一调用接口、输出适度下采样(省token)、结果完全确定性(保证数据构建、SFT、RL三个阶段看到的证据完全一致)。

从“会用工具”到“会挑时机”:两阶段训练

要让模型真正掌握这套本领,需要两种能力:知道怎么用工具,以及知道什么时候该用。IQA-T1用一条两阶段训练流水线来解决。

第一阶段:监督微调(SFT)——先学会“怎么用”

在自建的Q-Tool数据集上做监督微调,让模型掌握三件事:遵循结构化的推理模板、使用规范的工具调用语法、把视觉证据和质量判断关联起来。注意,模型不需要自己生成证据图(那是工具确定性产出的),训练时对证据图对应的token做了loss masking。

第二阶段:强化学习(RL)——再学会“何时用”

SFT教会了“怎么用”,但没优化“调用策略”。于是团队用GRPO做强化学习,专门打磨模型自适应调用工具的策略。奖励函数由四部分精心组合:

  • 格式奖励

:输出是否符合规范结构(含工具调用标签和最终分数);

  • 打分奖励

:预测分与真值越接近,奖励越高(指数衰减);

  • 工具使用奖励

:鼓励调用“适量”的工具——太少没证据,太多则惩罚冗余;

  • 重复惩罚

:一旦反复调用同一个工具刷存在感,直接扣分。

四项加权求和(

权重最高,给到5),最终让模型学会用尽量少、尽量对的工具,拿到尽量足的证据

数据集Q-Tool:第一个“证据推理”IQA数据集

现有IQA数据集里,没有一个支持“视觉证据推理”。团队干脆自己造了一个——Q-Tool,包含11k条高质量多模态推理链,每条都把工具生成的视觉证据和人类对齐的文字分析绑在一起。

它通过一条三阶段流水线构建:

  • 工具库构建:

即前文的7属性/15证据工具集;

  • 证据推理链合成:

先由人类专家写好 推理模板 (把画质评估拆成“看结构→分析噪声→评估色彩......”等阶段,并规定属性到工具的映射),再让 GPT-4o 在模板约束下生成完整推理链,避免模型放飞自我地“幻觉”;

  • 推理链验证:

工具是否用对、证据是否真正被引用、结论是否被证据支撑 三个维度逐条审查,不合格的直接删除,边缘case人工精修。

实验结果:7大基准综合SOTA

团队在KonIQ上训练,并在覆盖真实失真、合成失真、算法退化、AI生成内容的7个基准上评测跨分布泛化能力,对手包括传统手工方法、深度学习方法、以及最新的一众MLLM方法。

结果是,IQA-T1拿下了7个数据集平均PLCC 0.795/SRCC 0.784的综合第一:

对比只会打分、不会解释的MLLM方法 (如Q-Align、DeQA) ,IQA-T1在保持高精度的同时,还能给出 可解释、有证据 的推理链;

对比同样带推理的方法 (如Q-Insight、VisualQuality-R1、Zoom-IQA) ,它在 合成失真(CSIQ)和算法退化(PIPAL) 这两个硬骨头数据集上刷新了最好成绩,在真实图像和AI生成内容上也极具竞争力。

一个直观的例子最能说明问题:

更有意思的是关于“工具怎么调”的消融:

也就是说,工具不是用得越多越好——无关工具反而会引入冗余视觉token和干扰。IQA-T1的动态调用平均每张图只用2.34个工具,却拿到了全场最好的效果,还更省时省显存。这说明模型是真的在“基于证据推理”,而不是简单地“拟合分数”。

此外,把框架换到Qwen3-VL-2B、InternVL3.5-4B等不同基座上,性能趋势依旧稳定——证明“工具化视觉证据推理”是一种通用机制,而非某个特定模型的专属技巧。

团队

这项工作由西北工业大学香港科技大学联合完成。论文第一作者为西北工业大学的Jinjian Wu与香港科技大学的Jiaqi Tang(共同一作),通讯作者为西北工业大学的Wei Wei教授与香港科技大学的Qifeng Chen教授。

团队希望这项工作能启发更多研究:把结构化的视觉证据引入多模态推理系统,让大模型的“感知”变得更可靠、更可解释。

论文:https://arxiv.org/abs/2607.12375v1

代码:https://github.com/zibuyu-02/IQA-T1

模型:https://huggingface.co/zibuyu-02/IQA-T1

数据:https://huggingface.co/datasets/zibuyu-02/Q-Tool

Demo:https://huggingface.co/spaces/Jiaqi-hkust/IQA-T1

本文来自微信公众号“量子位”,作者:IQA-T1团队

相關問答

QIQA-T1的核心创新是什么?

AIQA-T1的核心创新在于,它首次让多模态大模型在评估图像质量时,从过去依赖‘直觉’或‘感觉’打分,转变为主动调用一套专业的视觉分析工具(如生成噪声残差图、傅里叶频谱图等),生成结构化的‘视觉证据’,并基于这些证据进行可解释、可追溯的推理和打分。

Q为什么传统多模态大模型在图像质量评估时容易‘凭感觉’打分?

A因为传统多模态大模型的视觉编码器主要擅长理解图像的高层语义(如‘猫’、‘海滩’),而对噪声、模糊、压缩伪影等底层视觉退化信息极不敏感。这就导致它看一张清晰的原图和一张严重退化的图片,其内部视觉表征可能非常相似,无法有效区分,因此只能依赖语义偏见进行猜测或‘凭感觉’给出分数。

QIQA-T1框架主要解决了哪两个关键能力,并通过什么训练方式实现的?

AIQA-T1框架主要解决了让模型‘知道怎么使用工具’和‘知道何时使用工具’这两个关键能力。这是通过一条两阶段的训练流水线实现的:第一阶段是监督微调(SFT),让模型学会遵循推理模板、正确调用工具;第二阶段是强化学习(RL),专门优化模型自适应调用工具的策略,使其能用最少、最相关的工具获取充分的证据。

QIQA-T1框架中,强化学习(RL)阶段的奖励函数包含哪几个部分?

AIQA-T1强化学习阶段的奖励函数包含四个部分:1. 格式奖励,确保输出符合规范结构;2. 打分奖励,鼓励预测分数与真实值接近;3. 工具使用奖励,鼓励调用适量(不多不少)的工具;4. 重复惩罚,防止模型重复调用同一个工具。其中打分奖励的权重最高。

QIQA-T1方法在评估结果上取得了什么成绩?与其他方法相比有何优势?

AIQA-T1在覆盖真实失真、合成失真、算法退化、AI生成内容等场景的7个图像质量评估基准上,取得了综合最优(SOTA)的成绩,平均PLCC/SRCC达到0.795/0.784。相较于其他方法,其优势在于:1. 在保持高精度的同时,能提供基于‘视觉证据’的可解释推理过程;2. 在合成失真和算法退化等挑战性数据集上表现尤为出色;3. 能够自适应调用少量关键工具,避免了冗余和干扰。

你可能也喜歡

如何让自己变得让人工智能永远也无法取代

面对人工智能的冲击,许多人担心工作被取代。然而,真正的威胁在于个人对他人和系统的依赖,以及由此产生的“薪资奴役”——即为生存而从事无意义、枯燥的工作。摆脱这种困境的关键,不是抵制技术,而是成为拥有高自主性的“不可受雇”个体。 文章提出了成功抵御AI替代的五个核心要素:自主性(主动行动的能力)、品味(判断事物价值的经验)、说服力(让他人关注你工作的能力)、毅力(坚持并从错误中学习)和迭代(根据反馈持续改进)。这些能力无法仅通过理论学习获得,必须通过实践来培养。 要启动转变,首先要彻底改变环境,重塑身份认同。其次,应选择一个能获得真实、快速反馈的实践领域,例如创业。在众多技能中,内容创作(媒体)比编写代码更具优势,因为其价值是主观的,需要独特的审美和判断力,这正是AI目前难以完全复制的。 具体行动上,可以从三个步骤开始: 1. **挖掘原始素材**:反思自己长期痴迷的知识领域、轻松解决的难题或童年被压抑的兴趣,找到独特的个人经验。 2. **确立反向思考主轴**:找出你坚信但主流观点错误的地方,或行业内普遍忽视的“皇帝新衣”,形成独特的批判性视角。 3. **立即发布**:将前两步的思考融合,撰写并发布第一个核心内容(如帖子、视频),勇敢接受真实世界的反馈,并在此基础上持续学习和迭代。 最终,抵御AI的关键在于构建一份与自身身份深度契合的毕生事业,通过持续的内容创作和真实互动,建立无法被自动化取代的独特价值和影响力。行动,从今天发布第一个想法开始。

marsbit6 分鐘前

如何让自己变得让人工智能永远也无法取代

marsbit6 分鐘前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

文章探讨了通过投掷骰子生成比特币钱包种子短语的安全方法及其现实挑战。核心观点如下: **1. 骰子提供物理熵源** 骰子结果由众多微小变量决定,理论上虽可预测,但实践中无法被攻击者复制或计算,从而提供高质量的随机性。每个六面骰子投掷约产生2.585比特熵,50次投掷即可满足典型12词助记词(128比特熵)的安全需求。 **2. Coldcard漏洞事件凸显手工熵源的价值** 近期Coldcard硬件钱包因固件漏洞导致其内部随机数生成器存在缺陷,致使约1128枚比特币被盗。但那些**完全**通过足量骰子投掷生成种子短语的用户未受此漏洞影响,因为他们的主密钥未使用有缺陷的生成器。 **3. 重要警示:手工种子并非万能保护** 安全研究员指出,即使用户使用骰子生成了安全的种子,若他们使用了Coldcard的其他功能(如生成纸钱包、克隆密钥、共享签名密钥、密码等),这些**衍生密钥**仍可能调用有漏洞的随机数生成器,从而存在风险。安全种子不保证设备生成的所有秘密都安全。 **4. 手工生成熵源的现实局限性** 尽管数学上可靠,但该方法对大多数用户并不友好: * **过程繁琐易错**:需投掷50-99次,精确记录,任何输入错误都会导致钱包完全不同。 * **引入新风险**:用户可能在记录、转换过程中泄露信息,或使用有偏的骰子/投掷方式。 * **用户体验差**:难以想象大规模推广需要用户手动投掷近百次骰子。安全措施需适应现实生活场景和普通用户的知识水平。 **5. 给用户的建议** 受影响的Coldcard用户应: * 更新固件至最新版。 * 检查是否使用过有漏洞的功能生成了次级密钥或密码,如有则需立即更换。 * 考虑采用多签方案,使用不同厂商的设备分散风险。 **结论**:手工投掷骰子生成熵源是技术娴熟用户的一个有效安全选项,但其过程复杂、容易出错,不适合作为主流用户的默认方法。长远目标是依赖安全、透明且无需专业知识的硬件/软件随机数生成方案。

cryptonews.ru3 小時前

通过掷骰子离线保管比特币密钥:并非人人愿意为之

cryptonews.ru3 小時前

交易

現貨
活动图片