高斯 GRPO 登场:用一维最优传输统一多模态 RL 奖励分布
kaiwei_chang · x · 2026-10-06
研究团队在 COLM 2026 发布 Gaussian GRPO (G²RPO),针对多模态 LLM 后训练中推理驱动与感知驱动任务奖励分布差异巨大的问题,提出用 1D 最优传输把每个任务的优势分布强制映射到标准正态分布,从而获得:
- 对离群值天然鲁棒
- 正负奖励对称更新
- 跨任务方差一致
配合任务级响应长度与熵调控,训练出 OpenVLThinker v2,在知识、数学、图表与文档理解等基准上表现强劲,并在多项评测中以同量级体量击败大 100 倍以上的闭源模型,达到相近尺寸开源模型中的 SOTA 视觉推理与感知水平。
「多模态」频道最新
- AI 生成视频太爆笑,网友:烧再多算力都值 — hexiang · 2026-10-06
- Midjourney+Threejs+Seedance 组合工作流:AI 生成多角度电影级镜头 — Ror_Fly · 2026-10-06
- Suno 能看图生歌,竟认出梗图里的 Gram-Schmidt 正交化 — anderssandberg · 2026-10-06
- Apple 研究员两篇流模型论文中选 NeurIPS,提出轨迹归一化模型 — thoma_gu · 2026-10-06
- Stability AI 暑期项目 SemanTok:49M 模型语义评测胜过 47 倍大对手 — CSProfKGD · 2026-10-06
- Magnific 预告 10 月 8 日发布新工具,简单 prompt 出效果惊艳 — aziz4ai · 2026-10-06