大连理工 BehR:世界模型越逼真,Agent 反而越跑偏
jiqizhixin · x · 2026-09-17
大连理工大学团队的 BehR 论文被 EMNLP 2026 主会接收,提出一个反直觉发现:文本世界模型一味追求“状态一致性”(生成文本越接近真实环境),反而可能让 Agent 的表现更差。
- 现有文本世界模型都以状态一致性为核心目标,比拼预测文本与真实环境的相似度
- BehR 把训练目标从状态一致性转向行为一致性:不问“预测环境像不像真的”,而问“Agent 在预测环境中的决策是否与真实环境一致”——当预测误差不可避免时,关键不是文本逼真,而是决策一致
- 实验结果:在 16 个实验配置中,BehR 在 13 个上提升轨迹级一致性,3 个打平,且无一变差
「漫话AGI」频道最新
- SBA 新贷款规则让 AI 商业计划书工具作者重新想:AI 到底替代什么 — MshoAlik · 2026-09-17
- 若超对齐无解,法律强制停止或是唯一出路 — jeremiecharris · 2026-09-17
- 别指望瞒住超级智能:Robert Miles 犀利吐槽安全靠保密 — harris_edouard · 2026-09-17
- WSJ 专访辞职引爆争议的 Anthropic「普通研究员」Jacob Coxon — KateClarkTweets · 2026-09-17
- AI 模拟 1930 年人脑,做「时间机器」社会实验 — iyadrahwan · 2026-09-17
- 设计师吐槽:AI 公司自比碟中谍,实际更像王牌大贱谍 — michalmalewicz · 2026-09-17