人大团队提出 AEWM:世界模型改写智能体任务状态而非模拟工具响应
RUC · hf · 2026-09-25
现有语言世界模型通常预测环境观测,但对高熵、依赖执行结果的工具响应做重建,在真实反馈可得时价值有限;且智能体存在"任务状态污染"——无依据的假设和过时计划滞留历史、扭曲后续决策。
RUC 团队提出 Agent-Editing World Model(AEWM),建模推理与动作如何塑造未来任务进展,而非模拟工具响应。核心组件:
- Action Judge:区分 Critical / Exploratory / Noisy 三类决策
- State Revision:对同一观测历史下的噪声推理-动作续写进行编辑
- EditAct:将这些能力与真实执行结合,直接改变后续决策所基于的状态
在 Search、Terminal、软件工程三个域上经中期训练与 SFT 后:Action Judge 基准宏 F1 达 70.5%,超最强前沿基线 10.6 分;跨 6 个基准、3 个智能体骨干,EditAct 平均提升 3.2–6.7 分;基于验证轨迹的拒绝采样微调 AEWM-RFT 再超 Self-RFT 2.2–2.6 分。
「编程与Agent」频道最新
- 有人把本地 LLM 当电脑主界面:装机、配 GRUB 都靠对话完成 — Forward_Jackfruit813 · 2026-09-25
- Agent 循环跑在哪、怎么失败:一篇讲透会话持久化的工程文章 — tempNull · 2026-09-25
- 像素画 prompt 被封装成 pixel-anims skill 开源,附更多示例 — majidmanzarpour · 2026-09-25
- 网友用 Opus 5.5 一段 prompt 纯代码生成会动的像素法师 — majidmanzarpour · 2026-09-25
- 用 Opus 5.5 搭建可视化 Claude Code 编排界面,agent 们下班后自己开工 — EricBuess · 2026-09-25
- System 1 模型 Jev 正在改变记忆与上下文工程的做法 — julianweisser · 2026-09-25