Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案
francoisfleuret · x · 2026-09-26
AI 研究员 François Fleuret 在系列线程中拆解 LLM 的工作机制:所谓「预测下一个 token」实际是按一个非常复杂的句子分布采样——就像能不看电子就预测台球走位一样,模型靠海量知识支撑这一分布。预训练阶段模型「只是」学习广泛模仿人类,而这一步本身就极其重要,因为它把关于几乎所有事物的丰富知识刻进了模型。随后在后训练阶段,模型学习修改这个分布,使其集中到「从问题通向有效答案」的 token 序列上。他总结:直接生成最终答案可能困难,但生成覆盖中间论证和结果的中间词序列——一系列可生成的小步骤——是可行的。
所属事件:Fleuret 七连推:LLM 不止预测下一个 token(6 条相关)→
「研究」频道最新
- Opus 5.5 一小时生成 3Blue1Brown 风格论文动画,全程零人工干预 — hsu_byron · 2026-09-26
- 训练 600M 小模型引入滑动注意力窗口与记忆机制的一手实验 — KlausCodes · 2026-09-26
- 医疗基准 Medmarks 获 NeurIPS 数据集与基准 track 接收 — iScienceLuvr · 2026-09-26
- Cadence 架构:面向持续高效智能流的新型设计 — rvp · 2026-09-26
- 550 条样本训练 15 分钟,小模型本地推理 0.06 秒替代 Gemini — newz2000 · 2026-09-26
- WetLabs 基准发布:9 项湿实验任务实测机器人能否加速科研 — ericjang11 · 2026-09-26