博主用 LLM 调用替代价值模型,agent 训练奖励方案再演进
cephaloform · x · 2026-08-18
博主分享其 agent 训练系统的一手迭代:此前的奖励只基于朴素的滑动窗口和按轮次历史/前瞻判断的规则指引,优势则用 EMA 计算,容易意外截断任务。现在改由模型自己用工具决定窗口大小,解决了这一问题。
下一步计划是把价值估计器的输出路由到训练器,让它比「带时间戳记忆的 RAG」更好地与 agent 共同演化。博主自嘲:以前开玩笑说价值模型会被一次 LLM 调用取代,现在真的在这么做了。
「编程与Agent」频道最新
- Anthropic 被曝开发 Hub 多智能体模式 — testingcatalog · 2026-08-18
- Agent 单文件内存溢出?生产级多步存储方案探讨 — Interesting-Year-418 · 2026-08-18
- KAISEN AI:利用遗传算法与本地 LLM 优化代码性能 — andreabarbato · 2026-08-18
- Compound Engineering 更新:新增技能与 Windows 支持 — every · 2026-08-18
- 编码 Agent 实用招:实现完跑 /simplify,再用新上下文复审 diff — lucasmeijer · 2026-08-18
- 开发者称 Go 语言适配 AI 编程 Agent 效果远超 Rust — dosco · 2026-08-18