CER 方法提前预测终局奖励,编码 Agent 训练省 52.7% token

shangbinfeng · x · 2026-10-08

论文提出 Contextual Early Reward(CER),解决长程编码 Agent 必须跑完整个 rollout 才能拿到可验证奖励的问题:从部分轨迹前缀预测最终奖励,同时用于测试时扩展(test-time scaling)和 RL 训练。

方法要点

实验结果

CER 为长程编码 Agent 提供了更高效、可解释的稠密奖励评估方式。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →