CoLT 让多模态模型用隐变量思考,推理提速 10.1 倍
jiqizhixin · x · 2026-07-23
新加坡南洋理工大学等机构提出 CoLT,让多模态模型不再靠冗长文本逐步推理,而是通过一串 latent thoughts(隐变量思维) 来完成中间推理。
关键做法
- 用隐藏表示代替显式文字链式思考。
- 通过一个轻量解码器对每个 latent step 做监督,保证训练稳定。
- 相比一些依赖昂贵图像标注的 latent reasoning 方法,标注成本更低。
论文结果
- 优于现有 latent reasoning 方法,如 CODI、SIM-CoT。
- 推理时间缩短 10.1 倍。
- 文本解码量减少 22.6 倍。
帖子同时给出论文、代码和报告,核心结论是:CoLT 让 VLM 的“思考”更短、更快,也更便宜。
「多模态」频道最新
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- 3D 网站生成工作流公开:MCP 接 Codex,一句话出可玩游戏 — FellMentKE · 2026-09-11
- 用 GPT-6 Astra 加 Hyper3D MCP 免建模做 3D 落地页 — FellMentKE · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11