Fleuret 七连推:LLM 不止预测下一个 token
Meta 研究员 François Fleuret 于 9 月 26 日在 Twitter 发布 7 连推长文,系统回应「LLM 只是在预测下一个 token」这一流行贬低说法。他的核心结论:这种描述字面上没错,但完全搞错了正确的抽象层级,信息量为零。
已确认
- Fleuret 指出,说模型「只是预测下一个 token」与说下棋程序「只是在移动电子」一样:描述属实,却不是理解系统的正确层级——对 LLM 的评价应该在句子分布这一抽象层面进行。
- 所谓「预测下一个 token」实际是按一个非常复杂的句子分布采样;就像人能不看电子就预测台球走位一样,模型靠海量知识支撑这一分布。
- 预训练阶段模型「只是」广泛模仿人类,但这一步本身就极其重要,因为它把关于几乎所有事物的丰富知识刻进了模型。
- 后训练阶段,模型学习修改这个分布,使其聚焦于生成有效答案。
- 关于推理:模型也许难以一步直接生成答案,但完全可以生成覆盖中间论证和中间结果的词序列,即一系列可逐步生成的小步骤。Fleuret 认为,由此「它只是预测下一个词」的真正含义变成「给定问题,生成逐步小步骤」,这种思维链式的中间结果生成已接近真实推理。
为什么重要
- 「只是预测下一个 token」是外界贬低 LLM 能力时最常引用的论据,Fleuret 的拆解为反驳提供了清晰的层次化框架:机制描述与能力评价应区分在合适的抽象层级上。
- 他将预训练(知识注入)与后训练(分布修正)的功能分工讲清楚,有助于公众理解为何「模仿人类」这一看似简单的目标能带来广泛知识,以及后训练如何把模型引向有效答案。
- 他对思维链的解读——通过可逐步生成的小步骤逼近推理——为「LLM 是否真正推理」这一争议给出了偏向肯定的立场。
2026-09-26 ~ 2026-09-26 · 6 条相关
一手来源
- François Fleuret:「只预测下一个token」的说法错在层级 — francoisfleuret ·
- Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案 — francoisfleuret ·
- Fleuret:思维链生成中间结果,已接近真实推理 — francoisfleuret ·
- 「只是移动电子」:Fleuret 用下棋类比反驳对 LLM 的贬低 — francoisfleuret · 2026-09-26
- 【源头】François Fleuret:「只预测下一个token」的说法错在层级 — francoisfleuret · 2026-09-26
- 【源头】Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案 — francoisfleuret · 2026-09-26
- 【源头】Fleuret:思维链生成中间结果,已接近真实推理 — francoisfleuret · 2026-09-26
另有 2 条近重复转述:francoisfleuret · francoisfleuret