IQA-T1:让大模型看图先取证

量子位 · wechat · 2026-07-20

这篇文章介绍了一个名为 IQA-T1 的多模态图像质量评估框架,核心目标是让大模型不再“凭感觉”给图像打分,而是先调用专业视觉工具生成证据,再基于证据推理。

文章指出,现有 MLLM 做 IQA 容易受语义偏见影响:模型更擅长识别“这是什么”,却不擅长捕捉噪声、模糊、压缩伪影等底层退化。IQA-T1 为此设计了 15 种视觉证据工具,覆盖噪声残差、傅里叶频谱、梯度一致性等属性,并用 SFT + GRPO 两阶段训练,让模型学会“怎么用工具”和“何时用工具”。

团队还构建了一个包含 11k 条推理链的 Q-Tool 数据集,在 7 个 IQA 基准上取得综合最优,平均 PLCC/SRCC 达到 0.795/0.784。文章同时强调,这套方法的优势不仅是分数更准,也让推理过程可解释、可追溯。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →