视频与文本预训练交替,世界模型能否融合赋予说话与行动能力?
voooooogel · x · 2026-08-20
探讨了一种假设性的模型训练方法:在预训练阶段交替进行视频和文本训练,并使用独立的输出头。猜想这种方法是否会让世界模型在某一点发生融合,并借鉴 Pantograph 的动作交替技术,通过低成本的交替微调,最终得到一个既能对话又能行动的模型。
「研究」频道最新
- Recirculation 在五个模型家族中均降低困惑度 — xennygrimmato_ · 2026-08-20
- Recirculation 架构助 Gemma3 困惑度显著降低 — xennygrimmato_ · 2026-08-20
- 对比 Unrolled loop 与 Recirculation Transformer — xennygrimmato_ · 2026-08-20
- Daphne Koller 谈 AI 制药瓶颈: 结构比算力更重要 — ziv_ravid · 2026-08-20
- SemaPLC:带验证门控的 PLC 代码生成 Agent 框架,实测通过率超基线 — Midea-AIRC · 2026-08-20
- 亚马逊提出模型谱系验证:利用权重余弦签名追踪来源 — amazon · 2026-08-20