Stability AI 发布 SemanTok:小模型tokenizer提升自回归视频生成效率
stabilityai · hf · 2026-10-02
Stability AI 在 Hugging Face 发布论文 SemanTok,针对自回归(AR)视频世界模型提出一种可变长度的语义视频 tokenizer。
核心改进:
- 将冻结的 DINO 特征注入 tokenizer 编码器,并为每个保留的 token 前缀添加轻量头,使其能独立重建这些语义特征
- 相比仅对早期解码器隐藏状态施加 REPA 损失的现有方案,语义对齐在每个噪声水平(包括纯噪声)下都更强
- 粗到细的结构让前缀 token 承载全局语义、后续 token 补充像素细节,短前缀更便宜且生成保真度更高
结果: 201M 参数的 SemanTok AR 模型可匹敌或超越 3.4 倍大的 VideoFlexTok AR 模型;更大模型保真度进一步提升,并在分布外类别上保持语义对齐。重建与生成两头都表现良好。
「多模态」频道最新
- 16GB 显存本地跑通 LTX 2.5 生成完整 MV,效果出乎意料 — sokmech · 2026-10-02
- Eleven v4 角色动画演示:音频驱动角色口型与表演 — buraktuyan · 2026-10-02
- 让 Claude 当导演:Fable 5.1 自主产出一支超现实主义 AI MV — cheetoskull · 2026-10-02
- Krea 2 Turbo 一体化 ComfyUI 工作流:2/4 步 LoRA 提速出图 — TimeTruth2490 · 2026-10-02
- 全队没人会用 Blender,靠 Claude 跑通整套 3D 电影工作流 — gen_ericai · 2026-10-02
- Meshy 预告 3D 局部编辑:选中区域输入文字即可改 — rms80 · 2026-10-02