阿里提出 PoS:显式信念状态治「信念陷阱」,四个基准全面领先

alibabagroup · hf · 2026-10-02

阿里巴巴提出推理时框架 PoS,为长程 LLM agent 构建并持续维护显式信念状态作为决策上下文:每个信念结合当前世界状态估计与未完成的任务需求,明确 agent 还需要学习和完成什么。PoS 通过一致性校验和任务进度监测来检测「信念陷阱」(Belief Trapping)——agent 一直在行动却未向目标推进——并按陷阱模式和需求类型定制恢复策略。在四个执行与诊断基准、三种 LLM 骨干上,PoS 均取得最高整体性能;消融验证一致性与恢复机制的重要性,上下文扩展实验显示其对上下文增长有韧性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →