SVR-R1 用自我验证提升多模态推理准确率
UIUC-CS · hf · 2026-07-21
SVR-R1 用自我验证提升多模态推理
这篇论文提出 Self-Verified Reasoner(SVR-R1),把多轮强化学习和模型自身的“自我判定”结合起来,用于多模态推理。
- 模型先给出答案,再用同一套权重输出二元自判定(Yes/No)。
- 如果判定为 No,模型会进入第二次思考;如果是 Yes 或达到轮次上限,则结束并计算奖励。
- 方法基于 GRPO 和异步多轮 rollout,不需要外部监督,也不需要额外 critic。
- 在视觉语言推理基准上,作者报告它相对强基线 显著提升准确率。
- 训练过程中,模型对验证的依赖逐渐下降,但测试准确率继续上升,说明它在内化自我修正能力。
作者表示会开源 SVR-R1,方便后续多模态推理研究。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22