大模型给图片打分不再“靠嘴说”,结构图、频谱图当“物证”,用“视觉证据”来给图片打分
传统多模态大模型在评估图像质量时,常因依赖高层语义理解而忽略底层退化细节,导致打分“凭感觉”而非基于证据。西北工业大学与香港科技大学团队提出新框架IQA-T1,首次让大模型在评估时能主动调用专业分析工具(如生成噪声残差图、傅里叶频谱等),形成结构化“视觉证据”来支持判断。该方法将图像质量评估转化为可解释的证据驱动推理。
IQA-T1通过两阶段训练:监督微调学习工具使用规范,强化学习优化工具调用策略,确保模型用最少、最相关的工具获取足够证据。团队还构建了首个支持证据推理的数据集Q-Tool。在7个基准测试中,IQA-T1取得了综合最优成绩(平均PLCC 0.795/SRCC 0.784),尤其在合成失真和算法退化数据集上表现突出,且其动态调用工具的策略(平均每图仅用2.34个工具)在保证精度的同时提升了效率与可解释性。
该工作表明,引入结构化视觉证据能使多模态推理更可靠、更可追溯,为相关研究提供了新范式。论文、代码、模型与数据均已开源。
marsbit07/20 07:46