EMNLP 2026 论文:文本世界模型该比「行为一致」而非文本相似,假阳性率 42.5% 降至 9.5%
机器之心 · wechat · 2026-09-08
大连理工、MBZUAI、北大与微软合作的 EMNLP 2026 论文提出,文本世界模型的主流训练目标(逼近真实文本)存在「指标反转」问题:遗漏目标商品的幻觉 BERTScore 更高,却让智能体任务失败;遗漏无关商品分数更低,反而无害。
核心方法 BehR(行为一致性奖励):冻结一个参考智能体,让它在真实状态与预测状态下对同一动作打分,两者对数概率之差作为奖励,用 GRPO 训练世界模型。不需要人工偏好标注。
实验结果:
- WebShop + TextWorld、Qwen2.5-7B/LLaMA3.1-8B 基座、4 种评测智能体共 16 组配置,13 组提升、3 组持平、无退化
- WebShop 上 Qwen3-8B 一致率从 0.345 提至 0.483,GPT-4o 从 0.760 提至 0.840
- 离线评估:TextWorld 上 Qwen3-0.6B 真实成功率 0%,基线世界模型误判 42.5% 任务为成功,BehR 降至 9.5%,一致率升至 90.5%
- 前瞻规划:帮助 Qwen3-8B 在 WebShop 成功率从 14.5% 升至 25.5%
结论:世界模型的价值不在于预测多像真实环境,而在于能否让智能体做出一致的决策行为。
「编程与Agent」频道最新
- 12GB 显卡跑 MiniMax H3:60 秒无缝长视频工作流实测 — vortis23 · 2026-09-08
- GPT-6 操纵浏览器打通 Blender 与海螺 H3,一条龙产出剧画风拳击短片 — Hailuo_AI · 2026-09-08
- Tibo 再度统一重置周期,用户推演「突袭重置」博弈与 token 省法 — tinyfool · 2026-09-08
- 四个小模型合并进一台推理服务器,doc-QA agent 运维负担大减 — Sad-Razzmatazz-7657 · 2026-09-08
- 让 AI 生成测试致测试目录指数膨胀,开发者热议如何把关 — arthurcolle · 2026-09-08
- Agent 可观测性工具严重缺位,开发者苦寻本地 OTEL 方案 — Cautious_Chicken_604 · 2026-09-08