用仿真里训练的 JEPA 世界模型给 LLM 注入物理直觉,可行吗?

Full_Promotion4522 · reddit · 2026-09-03

帖主提出一个研究构想:LLM 只学会了 "falls" 和 "gravity" 之间的统计关联,并无真正的物理直觉——本质是 "玛丽的房间" 问题。他的方案分三步:

假设是这样能让下游学习显著加速,因为 LLM 不必重新发现"物体会下落"。相关近邻工作:V-JEPA(对视频预测未来帧表示而非像素)、DreamerV3(用潜在世界模型做高效 RL),但 "JEPA 预测+仿真物理表示+接入 LLM" 的组合似乎没人干净地做过。

帖主向社区提出三个问题:是否有遗漏的先行工作?接地表示与语言模型的正确接口是什么(prompt 拼接还是 cross-attention)?sim-to-real 差距会不会杀死迁移?并询问是否值得做一个小原型。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →