人大团队提出 AEWM:世界模型改写智能体任务状态而非模拟工具响应

RUC · hf · 2026-09-25

现有语言世界模型通常预测环境观测,但对高熵、依赖执行结果的工具响应做重建,在真实反馈可得时价值有限;且智能体存在"任务状态污染"——无依据的假设和过时计划滞留历史、扭曲后续决策。

RUC 团队提出 Agent-Editing World Model(AEWM),建模推理与动作如何塑造未来任务进展,而非模拟工具响应。核心组件:

在 Search、Terminal、软件工程三个域上经中期训练与 SFT 后:Action Judge 基准宏 F1 达 70.5%,超最强前沿基线 10.6 分;跨 6 个基准、3 个智能体骨干,EditAct 平均提升 3.2–6.7 分;基于验证轨迹的拒绝采样微调 AEWM-RFT 再超 Self-RFT 2.2–2.6 分。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →