KATok 自适应视频 tokenizer:丢弃冗余 token 压缩视频表征
kakaocorp · hf · 2026-09-01
KATok(Keep-or-Drop Adaptive Tokenizer) 是 Kakao 发布的自适应视频 tokenizer,基于 transformer,核心机制是选择性丢弃无信息量的 token,实现数据依赖的压缩,同时在扩散生成中保持空间一致性。
相比固定压缩比方案,KATok 让视频表征更紧凑,服务于下游的扩散模型视频生成。
「多模态」频道最新
- Runway 发布 Solaris:端到端神经软件,实时视频模型直接生成 UI — anselm · 2026-09-01
- Krea2-SDA LoRA 修复生成多样性不足痛点 — Gradio · 2026-09-01
- 阶跃星辰 CE3D++:对话式编辑 3D 与 4D 场景 — stepfun-ai · 2026-09-01
- 仅 CPU 实现视频人物追踪与背景模糊方案 — Exotic_Accountant565 · 2026-09-01
- 质疑 Minimax H3 混合模型:参考图遵循能力弱于预期 — Tablaski · 2026-09-01
- ABot-Recon 上线 Hugging Face:行车记录仪视频几秒变 3D 扫描 — petewoodbridge · 2026-09-01