CER 方法提前预测终局奖励,编码 Agent 训练省 52.7% token
shangbinfeng · x · 2026-10-08
论文提出 Contextual Early Reward(CER),解决长程编码 Agent 必须跑完整个 rollout 才能拿到可验证奖励的问题:从部分轨迹前缀预测最终奖励,同时用于测试时扩展(test-time scaling)和 RL 训练。
方法要点
- 根据从相似历史任务总结的经验,为当前任务和阶段自适应生成评分 rubric
- 通过轨迹前缀中的行为证据预测终局奖励,提供稠密、可解释的评估
实验结果
- SWE-bench Verified 测试时扩展:Nemotron 3 Ultra 上 RM@8 较最强基线提升 4.2 个百分点,Qwen 3.6 27B 提升 2.0 pp
- Nemotron 上仅需 15.3% 的 token 即可匹配最佳基线性能
- RL 训练:超过全 rollout TMax 1.9 pp,同时在线 policy 与 judge token 减少 52.7%
CER 为长程编码 Agent 提供了更高效、可解释的稠密奖励评估方式。
「编程与Agent」频道最新
- 3 个 AI Agent 优化代码被并入 SGLang-Omni 主干 — ChengleiSi · 2026-10-08
- Addy Osmani 称无需单独模型做对抗性审查,同会话即可 — addyosmani · 2026-10-08
- DuckDB 官方演示「零数据」数据库:几百 KB 管理整个数据湖 — RexDouglass · 2026-10-08
- 开发者开源 Replit 游戏 Drift 的烟雾效果,附 Agent 一键导入流程 — techartist_ · 2026-10-08
- 工程师回应 AI 代码类比:拓扑优化零件多为好看不中用 — rms80 · 2026-10-08
- Massive 数据接入 AI agent,经 x402 按次付费每次仅一美分 — kleffew94 · 2026-10-08