符号状态监督让视频模型以 1/30 算力达成同等推理性能
niloofar_mire · x · 2026-10-03
- 论文用 2x2x2 魔方任务测试视频生成模型的隐状态推理:模型需从固定三面视角预测接下来九步操作后的隐藏贴纸状态。
- 结论一:验证 MSE 近似幂律下降,但更低 loss 并不可靠地代表下游推理能力;70M 自回归模型在约 0.1 PF-days 时帧准确率 44.6%,而 1B 模型同时期仅 0.3%,要到 3.14 PF-days 才达 83.7%。
- 结论二:加入符号状态监督后,20M 模型在同等训练数据预算下帧准确率从 31.1% 升至 67.3%,约 1/30 算力即可匹敌纯视频模型——学习状态变化的可扩展符号表征可能是 scaling 之外的关键互补路线。
「多模态」频道最新
- 全程代码渲染:开发者零 After Effects 做出 60fps 产品发布视频 — Emergency-Pack2500 · 2026-10-03
- Gemini iOS 更新现 GemPix 2.5 Flash 字样,新图像模型或将至 — lyraxana · 2026-10-03
- PotionUI 0.0.14:自托管 AI 生图视频应用接入 OpenRouter 云端模型 — 0roborus_ · 2026-10-03
- 研究员花两周从零训练扩散模型作画,称结果美得让他不安 — pbaylies · 2026-10-03
- 用 Kling 制作的科幻假预告片《Static》引发关注 — SightsFilms · 2026-10-03
- Reddit 网友发布 AI 生成心理恐怖短片《SITCOM》 — Sufficient_Flow_415 · 2026-10-03