文本也可走连续潜空间生成

LucaAmb · x · 2026-07-17

这条转发介绍了一篇关于生成建模的新工作 **Latent Thought Flows**。 作者先概括了当前生成模型的一个共同路线: - 图像、视频、音频、动作等模态,普遍会先压缩到**连续潜空间**,再在潜空间中生成,最后解码出来。 - 唯一还在主要依赖离散 token 自回归生成的,是语言。 这篇工作尝试把这一思路引入文本: - 将 **256 个文本 token 压缩成 8 个连续 latent**; - 用 **一步 flow model** 在 latent 上生成; - 再通过 **自回归解码器** 还原成文本。 作者声称,这种方法在**推理计算量与生成质量的折中**上,优于一个调参后的自回归基线。

所属事件:Latent Thought Flows:文本压缩至连续潜空间生成(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →