蚂蚁RCCA把功能条款对准代码片段,MiniAppBench从9分拉到41,略超Opus 4.5

Rubric-to-Code Credit Assignment for Reinforcement Learning

Rui Jin, Jikai Chen, Yihan Chen, Hao Zhou, Demin Zhu, Kaichen Yang, Dong Wang, Chenyi Zhuang

cs.AI

2026-08-28

蚂蚁把交互网页的功能条款对齐到页面代码片段,再按责任区域给GRPO加权。训练后的模型在MiniAppBench上拿到41.25分,略超Opus 4.5,并在ArtifactsBench上超过官方榜的GPT-5。

这篇在解决什么

交互网页生成要一次性吐出能跑的HTML、CSS、JavaScript:点按钮弹出面板、输入框改展示、状态机走对。质量由一组用户可见的功能条款决定,每条条款往往只对应一小段代码,事件处理、状态更新、DOM片段或CSS选择器。标准GRPO把这些条款压成一个序列级奖励,优势再均匀摊到所有token上。应用哪一段写对了、哪一段写炸了,更新看不出来。

蚂蚁Inclusion AI把这个问题叫Rubric-to-Code Credit Assignment(RCCA):条款级对错要对准到代码跨度,再变成GRPO里的token权重。

方法

每道训练题是自然语言需求加一组可执行条款。条款分两类:加载后就该成立的初始态,以及交互之后才检查的动态行为。评测器不只打分,还用文字指出责任区域。

样本级用门控分层奖励。格式坏或源码无效,奖励为0;能解析但运行失败,给0.1;通过运行再按条款算0.2到1.0。条款按核心功能、行为正确、渲染质量分档,违规按重要性和严重度扣分,下限0.2。关键条款严重失败会加分顶,防止次要项把大洞填平。

定位阶段把评测器指出的代码摘录、函数、事件绑定扩到包围函数、状态读写和调用关系,再和tokenizer offset对齐。直接相关token权重3.0,上下文相关1.5,其余1.0,诊断权重封顶4.0。优势为负时,这些权重砸在出错区域;优势为正时,出错区域不再加码,未受影响的token略升到1.2。组相对优势和clip都保持GRPO原样,改的只是token上的损失权重。

基座是Ling-3.0-Flash,124B混合线性MoE,每token激活5.1B。先SFT拿到初始制品能力,再上RCCA。

结果

MiniAppBench平均通过率:

模型EasyMidHard平均
Ling-3.0-Flash12.948.995.499.05
+SFT37.4122.4522.4426.85
Ling-RCCA-Flash53.3935.0337.6041.25
Claude Opus 4.559.0941.1822.3341.14
GPT-5.174.7121.373.4932.00

相对基座+32.20分,相对SFT再+14.40分,总平均略高于Opus 4.5。Hard上37.60对Opus的22.33,差距更大。分域并不均匀:Lifestyle 70.00、Visualization 63.46,Tools只有24.14,低于Opus的47.50。

ArtifactsBench官方榜设定下,RCCA 76.19,SFT 71.71,GPT-5 72.55。论文把这4.48分的外推写成实现层行为,而不只是MiniAppBench过拟合。主文没有把「只有分层奖励、没有token加权」拆成单独消融。

为什么重要

做应用生成RL的人,终于可以把环境里已经有的条款、交互轨迹和诊断,写成对具体DOM和事件处理的更新,而不是整段代码一个标量。SFT已经把9分抬到27分,RCCA是在这之上再抠实现细节。模型是5.1B激活的MoE,分数能摸到Opus 4.5的平均线,Hard和可视化更强,工具类更弱,不能当全面超越读。

局限与存疑

作者自己写了:评测停在单页HTML应用,多页、后端、持久化、登录和上线约束都不在范围内。RCCA依赖评测器的条款判断和文字归因,归因错了,梯度就会打到错误跨度,远距离交互尤其危险。没有报告定位准确率,也没有「分层奖励 + 均匀GRPO」对照,14.40分里有多少来自token加权,读论文的人无法拆开。Tools域相对闭源模型明显落后,转移并不均匀。生成代码的安全性和无障碍也只在伦理节里提醒人工检查。

术语

原文与代码

相关论文

全部论文解读