优化 Agent 奖励机制:模型自动决策窗口避免数据截断
cephaloform · x · 2026-08-18
开发者更新了 Agent 的奖励计算机制。此前使用固定滑动窗口和 EMA 计算优势,容易导致任务数据被意外截断。改进后,模型通过工具自主决定窗口大小,避免了数据丢失问题,能更完整地处理历史上下文。
所属事件:开发者打造本地 Agent 夜间自动训练闭环(4 条相关)→
「编程与Agent」频道最新
- 零成本用 AI 啃源码:一条 prompt 搞懂 VSCode 终端链接解析 — lucasmeijer · 2026-08-18
- Cursor 工程师自述:不再写代码,只做 Agent 团队品控 — cen6wkf · 2026-08-18
- 复盘 155 个 agent 任务:最贵的失败是工具返回成功却什么都没做 — ranbuman · 2026-08-18
- Anthropic 被曝开发 Hub 多智能体模式 — testingcatalog · 2026-08-18
- Agent 单文件内存溢出?生产级多步存储方案探讨 — Interesting-Year-418 · 2026-08-18
- KAISEN AI:利用遗传算法与本地 LLM 优化代码性能 — andreabarbato · 2026-08-18