新论文:Transformer 内部有忠实世界模型却行为失灵
xuanalogue · x · 2026-09-23
BeckmannPierre 等人发布新论文《World Modeling in Transformers》,研究 AI 模型能否仅从数据中恢复出世界模型。他们以 taxiGPT 为对象,发现 Transformer 内部存在忠实的内部世界地图,但行为上却无法正确执行。
通过机制可解释性追踪,失败原因在于这张地图以叠加(superposition)方式存储在模型内部。转发者评价这是很棒的工作,并指出其中 NextLat 的世界模型在机制层面表现最好,尽管仍不完美。
所属事件:新论文:Transformer 内部存在忠实世界模型但被干扰(3 条相关)→
「模型」频道最新
- 观点:模型降价让开发者可以「浪费」token 试新工作流 — pvncher · 2026-09-23
- 交互式 DeepSeek-V4.1-Flash 架构图上线,拆解 HF 参考实现 — vtabbott_ · 2026-09-23
- Cognition 送上大礼:Devin 接入 GPT-6 全系新模型,还送 50 份 Max 计划 — EricBuess · 2026-09-23
- 两个 LLM 驱动机器人格斗:GPT-6 Astra 31 秒逼退 Claude Opus 5.5 — DJiafei · 2026-09-23
- CliffCompaction 两行命令接入 Codex,开源模型压缩更优 — Tim_Dettmers · 2026-09-23
- Dettmers 换主力:DeepSeek v4.1 长程工程任务压过 Astra — Tim_Dettmers · 2026-09-23