IQA-T1:让大模型看图先取证
量子位 · wechat · 2026-07-20
这篇文章介绍了一个名为 IQA-T1 的多模态图像质量评估框架,核心目标是让大模型不再“凭感觉”给图像打分,而是先调用专业视觉工具生成证据,再基于证据推理。
文章指出,现有 MLLM 做 IQA 容易受语义偏见影响:模型更擅长识别“这是什么”,却不擅长捕捉噪声、模糊、压缩伪影等底层退化。IQA-T1 为此设计了 15 种视觉证据工具,覆盖噪声残差、傅里叶频谱、梯度一致性等属性,并用 SFT + GRPO 两阶段训练,让模型学会“怎么用工具”和“何时用工具”。
团队还构建了一个包含 11k 条推理链的 Q-Tool 数据集,在 7 个 IQA 基准上取得综合最优,平均 PLCC/SRCC 达到 0.795/0.784。文章同时强调,这套方法的优势不仅是分数更准,也让推理过程可解释、可追溯。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22