优化 Agent 奖励机制:模型自动决策窗口避免数据截断

cephaloform · x · 2026-08-18

开发者更新了 Agent 的奖励计算机制。此前使用固定滑动窗口和 EMA 计算优势,容易导致任务数据被意外截断。改进后,模型通过工具自主决定窗口大小,避免了数据丢失问题,能更完整地处理历史上下文。

所属事件:开发者打造本地 Agent 夜间自动训练闭环(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →