博主用 LLM 调用替代价值模型,agent 训练奖励方案再演进

cephaloform · x · 2026-08-18

博主分享其 agent 训练系统的一手迭代:此前的奖励只基于朴素的滑动窗口和按轮次历史/前瞻判断的规则指引,优势则用 EMA 计算,容易意外截断任务。现在改由模型自己用工具决定窗口大小,解决了这一问题。

下一步计划是把价值估计器的输出路由到训练器,让它比「带时间戳记忆的 RAG」更好地与 agent 共同演化。博主自嘲:以前开玩笑说价值模型会被一次 LLM 调用取代,现在真的在这么做了。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →