高斯 GRPO 登场:用一维最优传输统一多模态 RL 奖励分布

kaiwei_chang · x · 2026-10-06

研究团队在 COLM 2026 发布 Gaussian GRPO (G²RPO),针对多模态 LLM 后训练中推理驱动与感知驱动任务奖励分布差异巨大的问题,提出用 1D 最优传输把每个任务的优势分布强制映射到标准正态分布,从而获得:

配合任务级响应长度与熵调控,训练出 OpenVLThinker v2,在知识、数学、图表与文档理解等基准上表现强劲,并在多项评测中以同量级体量击败大 100 倍以上的闭源模型,达到相近尺寸开源模型中的 SOTA 视觉推理与感知水平。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →