文本也可走连续潜空间生成
LucaAmb · x · 2026-07-17
这条转发介绍了一篇关于生成建模的新工作 **Latent Thought Flows**。 作者先概括了当前生成模型的一个共同路线: - 图像、视频、音频、动作等模态,普遍会先压缩到**连续潜空间**,再在潜空间中生成,最后解码出来。 - 唯一还在主要依赖离散 token 自回归生成的,是语言。 这篇工作尝试把这一思路引入文本: - 将 **256 个文本 token 压缩成 8 个连续 latent**; - 用 **一步 flow model** 在 latent 上生成; - 再通过 **自回归解码器** 还原成文本。 作者声称,这种方法在**推理计算量与生成质量的折中**上,优于一个调参后的自回归基线。
所属事件:Latent Thought Flows:文本压缩至连续潜空间生成(2 条相关)→
「研究」频道最新
- DiFA 让扩散模型推理对齐前向统计,生成质量更高 — cn-scut · 2026-07-21
- 微软研究院把 LLM Judge 变 Coach,优于 rubric RL — MicrosoftResearch · 2026-07-21
- OpenLongTail 用生成视角补齐长尾自动驾驶数据 — TexasAMUniversity · 2026-07-21
- GEPO 用组熵改造 GRPO,在 13 项基准上更稳更强 — internlm · 2026-07-21
- 阿里 RynnBrain 1.1 把具身基础模型扩到 122B-A10B — Alibaba-DAMO-Academy · 2026-07-21
- Apple 提出无需真实环境的 API 智能体合成数据方法 — _akhaliq · 2026-07-21