KATok 自适应视频 tokenizer:丢弃冗余 token 压缩视频表征

kakaocorp · hf · 2026-09-01

KATok(Keep-or-Drop Adaptive Tokenizer) 是 Kakao 发布的自适应视频 tokenizer,基于 transformer,核心机制是选择性丢弃无信息量的 token,实现数据依赖的压缩,同时在扩散生成中保持空间一致性。

相比固定压缩比方案,KATok 让视频表征更紧凑,服务于下游的扩散模型视频生成。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →