显式信念状态让长程 agent 四基准全胜,代价是 5 倍 token

Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States

Yu Luo, Jiamin Jiang, Yimin Zuo, Xidao Wen, Rongchen Gao, Yongqian Sun, Shenglin Zhang, Guiyang Liu, Cheng Zhang, Fang Situ, Qi Zhou, Dan Pei

cs.AI

2026-10-01

PoS 让长程 agent 边交互边维护经校验的显式信念并自动逃出卡死,四个基准、三个模型全部第一,ALFWorld 相对提升 22.68%。

这篇在解决什么

长程 LLM agent 的主流上下文方案本质上是记忆管理:raw trajectory 原样堆着,ACON 压缩,PACE 按相关性调粒度,HiAgent 按子目标分层。这些方案保留的是「过去发生过什么」的证据,不保证 agent 对世界当前状态有一份自洽判断。任务一长,动作改变环境、新观测推翻旧推断,上下文里新旧事实与中间判断混在一起,模型分不清哪些还成立;LLM 自己写下的状态更新还可能自相矛盾,论文举的例子是同一台微波炉被记成既开又关,后续动作直接失去依据。

第二种失败模式被命名为 Belief Trapping:agent 一直在动作,但对目标零推进,重复无效动作、在几个状态间绕圈、不停收集用不上的信息,直到 budget 耗尽。此前的 T3 只在训练时检测信念偏差并截断轨迹,CGDP 用 exhaustion gate 直接终止,都无法在回合内把进度救回来。

方法

PoS(Progression of States)是纯推理时框架,不训练、不换模型,理论基座是 POMDP 的 belief state,分三块:

健康分用乘法有讲究:几何平均会在停滞、复现只出现其一时漏检,纯取 max 会把「gap 未关闭但持续推进」误判为卡死;乘积只把「持续未决 × 停滞或复现」算作陷阱。

结果

四个基准:ALFWorld、LOCA-Bench(执行类),RCA-100(微服务根因定位)、ClinDiag(临床诊断);三个 backbone:Qwen3.7-Plus、Kimi-K3、GLM-5.3;基线含 Raw Trajectory、ACON、PACE、HiAgent、LongHorizon-Harness。PoS 在全部 12 个基准 × backbone 组合上排名第一,相对同 backbone 最强基线的提升上限:ALFWorld +22.68%、LOCA-Bench +7.53%、RCA-100 joint 准确率 +37.89%、ClinDiag +11.31%。

设置(Qwen3.7-Plus)Raw Trajectory最强基线PoS
ALFWorld 成功率62.6972.39(LongHorizon-Harness)88.81
LOCA-Bench 成功率43.6252.57(LongHorizon-Harness)56.38
RCA-100 joint 准确率24.2728.16(PACE/HiAgent)38.83

消融:去掉一致性校验,ALFWorld 掉 14.93 分、LOCA 掉 11.81 分,ClinDiag 只掉 0.33–0.66 分;去掉卡死诊断与恢复,RCA-100 掉 4.85–6.79 分、ClinDiag 掉 2.65–3.97 分。把因子化恢复换成一句通用「请恢复」提示,四个基准全部变差,ALFWorld 从 88.81 掉到 76.87。

成本与扩展性:RCA-100 每集总 token 从 355.7K 涨到 1800.1K(5.06 倍),任务 agent 本身反而省 20.9%,开销全在信念构建(697K)与审计(822K);上下文从 96K 涨到 256K 时成绩基本持平,256K 处领先最强基线 10.67–16.00 分。卡死本身很常见,发生率 14%–94%,更强 backbone 发生率更低,但发生率低不等于准确率高:RCA-100 上 Kimi-K3 卡死率 74%、GLM-5.3 为 53%,Kimi 的 joint 准确率反而更高。

为什么重要

对 agent 记忆这条线,这篇的判断很直接:对现代长上下文模型,压缩和整理历史不稳定优于原样保留。PACE 在 LOCA-Bench 上比 raw 低 24.57–28.19 分,GLM-5.3 上 ClinDiag 没有任何一个基线赢过 raw。算力该花在维护一份可校验的当前世界估计上,这是从「存历史」到「养状态」的转向。PoS 用 5 倍 token 换准确率和长上下文稳定性,权衡数字摆得全,工程团队可以按预算决策;机制免训练,同一 backbone 自己审计自己,根因定位、问诊、具身操作这类需要跨步维护状态的任务可以直接借鉴。

局限与存疑

术语

原文与代码

相关论文

全部论文解读