评分细则跟着模型一起进化,音频推理 RL 拿下三项基准最高分

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou

cs.SD, cs.CL

2026-08-04

把「评分细则」做成随策略一起升级的过程奖励,基于 Qwen2.5-Omni-7B 的训练在 MMAU、MMAR、MMSU 三项音频推理基准上拿到同规模最好成绩。

这篇在解决什么

用强化学习训练大型音频语言模型(LALM)回答关于声音的问题,最常用的做法是只看最终答案对不对(outcome reward)。这种奖励有个漏洞:模型可以靠文本里的语言先验蒙对答案,根本没认真听音频。另一种做法给推理过程打分(process reward),但标准是人手写、写死的一套规则,既不分题型,也不锚定到音频证据,而且模型一旦学会了这套规则,奖励信号就饱和、不再给出梯度。问题在于,音频问题差别很大:有的只需听准声音,有的需要多步推理;用一把固定尺子量所有题,既不公平也很快失效。

方法

AudioRubrics 用一套会进化的「评分细则」(rubric)给推理过程打分,叠加在原有的答案奖励上。核心是三件事。

一是细则锚定到声音。它把原始波形(不是文本转写)直接喂给一个同时当「细则生成器」和「裁判」的音频模型(Gemini-3.1-Pro),让它针对每道题生成几条二值化的好/坏判据,每条都要求引用这段音频里真实存在的内容,权重加起来为 1。

二是细则跟着策略一起进化。训练每一步,模型先采 8 条 rollout,裁判对比这些 rollout,淘汰那些「全员通过或全员失败」、没有区分度的细则(用组内标准差过滤),再从 rollout 之间的差异里提炼出更难的新细则,包括正面细则难以表达的「失败模式」类负向判据。被留下的细则带入下一轮,评判标准只升不降,始终瞄着模型当前的弱点。新细则的占比从训练初期的约 35% 涨到末期的约 60%,说明细则集一直在更新。

三是防止为了凑细则而把推理写得更长。过程奖励天然鼓励模型多写,容易退化成冗长、绕圈、甚至幻觉的推理链。作者加了一个对推理长度的线性惩罚,和过程奖励互相制衡:一者奖励写得更有信息量,另一者限制写得多。

最终每个 rollout 的奖励是答案奖励、细则奖励、长度惩罚三者的加权和,用 GRPO 优化。

结果

基座是 Qwen2.5-Omni-7B,4 张 H100,GRPO 训 400 步,训练数据来自 AVQA(约 4 万条)。在 MMAU、MMAR、MMSU 三个基准上,AudioRubrics 的整体准确率均列同规模模型最好,MMAU 78.0%、MMAR 65.8%,连规模更大的闭源 Gemini-3.1-Pro(77.6%)在 MMAU 上也不及它。

基准AudioRubrics最强同规模基线GRPO(只看答案)
MMAU78.077.1(CESAR)75.2
MMAR65.865.3(Audio-Thinker)62.2

MMSU 的感知分比同规模最强基线高 4.3 分(相对 8.9%)。消融看得很清楚:去掉长度惩罚,MMAU 掉到 77.2;再去掉进化机制(只用初始静态细则),掉到 76.2;连静态细则也去掉只留 RL,掉到 75.2;完全不训练只有 65.2。每个组件都在贡献。

一个明显发现是方法高度依赖裁判模型的强弱。把 Gemini-3.1-Pro 换成更弱的 GPT-audio-1.5 当生成器加裁判,性能不升反降,甚至低于纯 GRPO。弱模型产出的细则不够准、不够锚定声音,反而成了噪声奖励。训练中响应长度的变化也印证了设计:纯 GRPO 会把推理越压越短直到几乎为零,去掉长度惩罚则无限膨胀,完整方法稳定在一个窄区间。

为什么重要

目前大多数音频大模型的「推理」其实是文本先验在起作用,模型答对了不等于真听懂了。这篇把监督信号钉在「推理过程是否基于真实听到的声音」上,给出一条可复用路径:把 LLM-as-judge 细则化、过程化,并让它随训练动态升级。对做语音和音频多模态后训练的人,这套机制可以直接搬;对更广的开放域 RL,「让奖励标准跟着策略进化」这个思路也值得借鉴。

局限与存疑

方法的上限被裁判模型卡死,需要一个既懂音频又会写判据的强模型全程在线打分,这本身既贵又把效果绑在 Gemini-3.1-Pro 上。每步都要对 8 条 rollout 逐条评判并重写细则,推理开销显著高于普通 GRPO。评测全部是多项选择的音频问答,模型是不是在开放生成里也学会「基于声音推理」,论文没给证据。作者承认收益随裁判能力增长,但没讨论当裁判和被训练模型能力接近时信号会不会再次饱和。

术语

原文与代码

相关论文

全部论文解读