Salesforce 论文:最干净的公开 RL 环境库仅 35.8% 通过审计
dair_ai · x · 2026-09-24
Salesforce AI Research 发表论文,强调 RL 环境中「验证器质量」的关键作用——审计发现最干净的公开终端 Agent RL 环境库也只有 35.8% 的环境合格,另两个公开库的合格率仅 10.1% 和 3.3%。
- 奖励错误双向存在:有的环境因答案泄漏或验证器太弱而错误给 1 分;有的因参考答案/Oracle 本身错误,把正确解判 0 分
- 模型对比:预算固定 3.5K 环境时,River-8B 在四个终端基准上平均 19.4 分,高于从同一库随机采样 3.5K 环境训练的 RL 模型的 17.7 分
- 核心论点:RL 的主要作用是塑造行为——先检查再行动、完成前先验证、及时放弃无效思路——而好验证器决定了这些行为能否被正确强化
「编程与Agent」频道最新
- 用 AI 实时造游戏开发工具:比 one-shot 更爽的是过程自由 — eschadiol · 2026-09-24
- RealSense 高管谈 AgenticROS:让 AI 智能体直接操控实体机器人 — chrismatthieu · 2026-09-24
- AWS API Gateway 10MB 上传上限无解,预签名 URL 才是正解 — _jaydeepkarale · 2026-09-24
- 开源 Pragma 工作区:一套 CLI 管理多个并行编码 Agent — tech_w0rld · 2026-09-24
- 开发者用 GPT-6 Astra 自建密集任务标注系统,封装成可复用 skill — chris_j_paxton · 2026-09-24
- 用 Jev 当 LLM Judge:低置信度升级到前沿模型省成本 — omarsar0 · 2026-09-24