Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案

francoisfleuret · x · 2026-09-26

AI 研究员 François Fleuret 在系列线程中拆解 LLM 的工作机制:所谓「预测下一个 token」实际是按一个非常复杂的句子分布采样——就像能不看电子就预测台球走位一样,模型靠海量知识支撑这一分布。预训练阶段模型「只是」学习广泛模仿人类,而这一步本身就极其重要,因为它把关于几乎所有事物的丰富知识刻进了模型。随后在后训练阶段,模型学习修改这个分布,使其集中到「从问题通向有效答案」的 token 序列上。他总结:直接生成最终答案可能困难,但生成覆盖中间论证和结果的中间词序列——一系列可生成的小步骤——是可行的。

所属事件:Fleuret 七连推:LLM 不止预测下一个 token(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →