LLM智能体训练与决策新方法

wzenus · x · 2026-07-10

CMU 研究者报告了 LLM-agent 训练中的两个相关方向:一是标量奖励会带来失败模式,作者提出用更丰富的文本反馈和自蒸馏来改进,并将方法称为 MaxRL,通过按任务难度归一化更新来稳定训练。

同场还介绍了 Calibrate-Then-Act:让语言模型智能体在不确定性与成本约束下更好地决定何时检索、何时追问澄清、何时做实验,以及何时停止。

所属事件:ICML 2026 FAGEN研讨会聚焦AI智能体失败模式(11 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →