CrEST 框架:解决多轮 Agent 训练中的信用分配难题
burny_tech · x · 2026-08-17
推文介绍了一篇关于多轮 AI Agent 训练的新论文及框架 CrEST。
- 背景问题:多轮 Agent 训练中,纯 RLVR(强化学习)虽然准确但难以在复杂步骤中分配信用;自蒸馏提供密集反馈但会限制模型潜力,浪费算力在格式化 token 上。
- CrEST 方案:
- 让验证者决定更新方向,让自教师严格控制更新幅度。
- 使用 Turn-Segmented Rewards 隔离错误发生的具体轮次。
- 引入 Entropy Gate 强制模型更新关键的决策 token,而非可预测的语法 token。
- 效果:在 WildToolBench 和 BFCL V3 等基准测试中,显著提升了长轨迹 Agent 会话的表现。
「研究」频道最新
- TLAPS-Bench 开放 alpha 版:测 AI 能否形式化证明系统正确性 — tianyin_xu · 2026-09-23
- ImIR 用图像自身作指令单适配器搞定六种图像修复 — Süleyman Aslan · 2026-09-23
- Quanta 解读:定价算法无需合谋也能推高物价 — burny_tech · 2026-09-23
- CodeMidas:从源码自动生成可执行的编码 RL 训练环境 — burny_tech · 2026-09-23
- 学者怀念 20 年前的方法论论文:没有防御性废话直击要点 — PMinervini · 2026-09-23
- 新论文:块三角联合漂移实现单步生成式代理模型 — chaumian · 2026-09-23