视频与文本预训练交替,世界模型能否融合赋予说话与行动能力?

voooooogel · x · 2026-08-20

探讨了一种假设性的模型训练方法:在预训练阶段交替进行视频和文本训练,并使用独立的输出头。猜想这种方法是否会让世界模型在某一点发生融合,并借鉴 Pantograph 的动作交替技术,通过低成本的交替微调,最终得到一个既能对话又能行动的模型。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →