Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案
francoisfleuret · x · 2026-09-26
AI 研究员 François Fleuret 在系列线程中拆解 LLM 的工作机制:所谓「预测下一个 token」实际是按一个非常复杂的句子分布采样——就像能不看电子就预测台球走位一样,模型靠海量知识支撑这一分布。预训练阶段模型「只是」学习广泛模仿人类,而这一步本身就极其重要,因为它把关于几乎所有事物的丰富知识刻进了模型。
所属事件:Fleuret 七连推:LLM 不止预测下一个 token(6 条相关)→
「研究」频道最新
- ICML 2027 程序主席求助:AI slop 投稿爆炸怎么管 — MarkSchmidtUBC · 2026-09-26
- 开源 Jevless:任意带 logprobs 的模型实现 Jev 式结构化决策 — seraphius · 2026-09-26
- 物理博客主披露为 Anthropic 写稿内幕:收费居中水平、拒签 NDA — burny_tech · 2026-09-26
- 论文《Mecha-nudges for Machines》入选 NeurIPS 2026 Spotlight — ethayarajh · 2026-09-26
- AutoScreen 用 AI 智能体重排 CRISPR 结果,湿实验证实癌细胞免疫逃逸基因 — KexinHuang5 · 2026-09-26
- 提示词修一处悄悄毁另一处:输出预算守恒导致无信号回归 — ClickOk5811 · 2026-09-26