EMNLP 2026 论文:文本世界模型该比「行为一致」而非文本相似,假阳性率 42.5% 降至 9.5%

机器之心 · wechat · 2026-09-08

大连理工、MBZUAI、北大与微软合作的 EMNLP 2026 论文提出,文本世界模型的主流训练目标(逼近真实文本)存在「指标反转」问题:遗漏目标商品的幻觉 BERTScore 更高,却让智能体任务失败;遗漏无关商品分数更低,反而无害。

核心方法 BehR(行为一致性奖励):冻结一个参考智能体,让它在真实状态与预测状态下对同一动作打分,两者对数概率之差作为奖励,用 GRPO 训练世界模型。不需要人工偏好标注。

实验结果:

结论:世界模型的价值不在于预测多像真实环境,而在于能否让智能体做出一致的决策行为。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →