新研究:LLM 或无需语言即可进行潜空间思考
CatAstro_Piyush · x · 2026-09-02
该论文提出在推理阶段将巨大的语言模型头部替换为更小的学习投影器。模型直接从一个连续嵌入移动到另一个,形成私有的潜在思维链,仅在需要给出最终答案时才恢复正常的语言头部。
核心发现:
- 这并不一定让单次尝试更聪明(Pass@1 往往更低),但显著减少了不同尝试之间的重复性。
- 通过在潜空间添加 Gumbel 噪声,增加了探索的多样性。
- 这意味着模型可能不再需要将思维强制转化为 Token,实现了去语言化的思考过程。
「研究」频道最新
- The World Labs 发布 Atlas:支持像素级相机控制 — Scobleizer · 2026-09-02
- PINNACLE 基准按「每正确任务成本」打分:模型已够好,该问谁决定升级 — ryanshrout · 2026-09-02
- Meta发布实时语音模型Muse,支持20人说话人分离 — bowenc0221 · 2026-09-02
- 4DAnyone 上线 Gradio:5090 显存优化至 32G 以下 — _akhaliq · 2026-09-02
- Muse Voice Transcribe:自适应延迟平衡速度与精度 — AIatMeta · 2026-09-02
- Speculative PTC: 将工具调用与代码生成并行以提速 — a1zhang · 2026-09-02