CE-GRPO按事件给几何推理记账,九项均分76.04,比整段GRPO高3.43点

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

Jiani Guo, Junjie Wang, Jie Wu, Pengxiang Zhao, Dongdong Zhang, Shaohan Huang, Yujiu Yang, Furu Wei

cs.LG, cs.CL

2026-08-31

清华与微软把几何图转成可执行代码并按事件分支,CE-GRPO九项均分76.04,比Qwen3-VL-8B高8.09点,比整段GRPO高3.43点,链路越长优势越大。

这篇在解决什么

多模态几何题要两件事同时做对:从图里抠出准确关系,再在多步推理里一直用对。错一次对象绑定、看错一个角、辅助线画偏,后面全废。

现有两条路是分开走的。PAL、ToRA、AlphaGeometry 这类方法把推理写成程序或形式语言,结构看得见,但优化还是对着整段回复。VinePPO、GPO、GRPO-MA 把优势估到中间步骤,边界却来自学出来的价值、固定切分或 token 统计。缺的是一个推理和训练共用的语义单元。

清华、微软亚洲研究院、浙大把这个原则叫 credit-addressable reasoning:推理时露出来的决策单元,同时也是学习时比较备选、分配 credit 的地址。

方法

先确认代码能不能当这个共享空间。在 MathVerse 五个子集上,图加外部生成的代码,六套模型都比单用图或单用代码强。开源模型自己写的代码,在同样的「只给代码」设置下落后外部代码 11.7–16.6 点。代码该留在图旁边,而且得由模型自己学会写。

Code-CoT 按这个要求装协议。模型保留原图,先写一份带行号、可执行的 Matplotlib 感知代码,再按四类事件往下推:think(推理)、reference(引用某几行代码支撑一个图上事实)、auxiliary(加辅助线或对象)、coordinate(建坐标系)。推理时这些标签就是检查点,训练时也是分支点。

监督微调用 18,302 条过检轨迹装协议:Gemini-3.1-Pro 把图转成代码,DeepSeek-V4-Pro 写后续事件。视觉编码器冻结,只训对齐器和语言模型。光靠提示不行,Code-CoT 提示把 Qwen3-VL-8B 从 67.95 拉到 49.26,协议必须学进去。

CE-GRPO(Critical-Event Group Relative Policy Optimization)在事件边界上做局部 credit。结构先验加类型内标准化熵选出候选事件;固定图、题和该事件之前的完整前缀,采样多条续写到最终答案;终端奖励的组内差异只回写到被重写的事件及其下游。前缀当 prompt,不进 policy loss。全体续写奖励一样,这组就不更新,选错主要浪费算力,不制造假监督。普通题和共享前缀题 1:1 混训,RL 题池 11,450 道。奖励是程序化的:结构不合法给 −1,合法则按正确性 + 0.3×动作合法率 − 重复/泄答惩罚,裁到 [−1, 1.3]。推理时贪心单次生成,不用外挂几何求解器,也不做测试时分支。

结果

九项几何基准,CE-GRPO 均分 76.04,相对 Qwen3-VL-8B 高 8.09,相对 Code-CoT SFT 高 6.49,相对整段 GRPO 高 3.43,九项全部超过骨干。增益集中在依赖链长的题:相对整段 GRPO,GeoLaux-mini +15.16,MM-Math +9.44;视觉 grounding 和常规平面几何上小一些,有的还互有胜负。

只看合法结束的回复,均分仍高 3.91,说明涨的是解题质量,不只是格式合规。图到代码的保真:100 道 MathVerse-TD 上,macro recall 从提示的 55.21% 到 SFT 的 70.16%,再到 CE-GRPO 的 80.43%;渲染成功率 89.0% 到 99.0%。MathVerse 从文本主导到纯视觉,TD–VO 差距从 30.07 收到 14.09,纯视觉项 +15.10。

选择器消融:随机前缀 72.48,只看熵 72.83,只看结构 74.26,结构+熵 76.04,未闭合率从 12.31% 降到 4.73%。结构选出改结局的事件大约比随机多 30%。CE-GRPO 相对整段 GRPO 的优势随中间事件数增加,每多一个事件大约 3.77 点(r=0.866, p=0.0016);整段 GRPO 相对 SFT 的增益随事件数掉得很快(−5.55 点/事件)。

相对两阶段系统 GDP-4B-RL 再接 Qwen3-VL-8B,单次调用均分高 3.07,九项赢七项;Geometry3K 落后 4.42 点,PGPS9K 落后 7.30 点,固定符号解析在关系型几何上还有优势。

方法九项均分
Qwen3-VL-8B67.95
Code-CoT 提示49.26
Code-CoT SFT69.55
整段 GRPO72.61
CE-GRPO76.04

为什么重要

对做长链推理 RL 的人,这篇把表征和 credit 往哪写绑成同一套地址。事件边界来自协议标签,不需要过程标注,也不需要额外的 value model。几何是个干净的试验田:辅助线、坐标系这些中间动作对不对,后面几步会立刻买单。

能直接拿去用的前提比较窄。推理时就是一次自回归,没有外挂求解器,8B 规模、贪心解码。协议本身很重,不会提示就会伤分。更适合中间结构清楚、结局信号延迟的任务,不要默认能搬到开放域视觉问答。

局限与存疑

正文没有独立的局限节,缺口得自己补。前缀从 SFT 策略上收一次就冻住,RL 过程中不再更新,后期策略分布可能已经漂了。整段 GRPO 基线用 8 条 rollout,CE-GRPO 用 4 条,算力预算并不对齐。答案判定靠 Gemini-3.1-Pro 和 Gemini-2.5-Pro 双评,引入裁判模型自己的偏差。SFT 轨迹由 Gemini 转图、DeepSeek 写推理,学生模型在模仿一套更强教师的协议。

Geometry3K 和 PGPS9K 上两阶段符号系统仍领先,说明把感知和推理揉进一次生成,并不是所有几何题都更划算。自评框架可推广到有显式中间结构的任务,这篇里没有非几何任务的数字。

术语

原文与代码

相关论文

全部论文解读