CoLT 让多模态模型用隐变量思考,推理提速 10.1 倍
jiqizhixin · x · 2026-07-23
新加坡南洋理工大学等机构提出 CoLT,让多模态模型不再靠冗长文本逐步推理,而是通过一串 latent thoughts(隐变量思维) 来完成中间推理。
关键做法
- 用隐藏表示代替显式文字链式思考。
- 通过一个轻量解码器对每个 latent step 做监督,保证训练稳定。
- 相比一些依赖昂贵图像标注的 latent reasoning 方法,标注成本更低。
论文结果
- 优于现有 latent reasoning 方法,如 CODI、SIM-CoT。
- 推理时间缩短 10.1 倍。
- 文本解码量减少 22.6 倍。
帖子同时给出论文、代码和报告,核心结论是:CoLT 让 VLM 的“思考”更短、更快,也更便宜。
「多模态」频道最新
- Reddit 讨论:Hunyuan Image 3.0 Instruct 值不值 170GB 显存 — dtdisapointingresult · 2026-07-23
- ComfyUI 出现开源 TTS 和声音克隆工作流 — Goble4 · 2026-07-23
- AI 生成短剧应用已占美国娱乐榜前 50 的 12 席 — deedydas · 2026-07-23
- FVAttn 让视频生成负载更均衡,注意力提速 4.41 倍 — Hao Liu · 2026-07-23
- VidBoards 把 AI 图片和视频对比做成了开源画布应用 — shangTsungTeaMaster · 2026-07-23
- K3 被指在多项基准上胜过 GPT-5.6 和 Fable 5 — yihui_indie · 2026-07-23