Fleuret 长文拆解:预训练模仿人类,后训练聚焦出有效答案
francoisfleuret · x · 2026-09-26
AI 研究员 François Fleuret 在系列线程中拆解 LLM 的工作机制:预训练阶段模型「只是」学习广泛模仿人类,而这一步本身就极其重要,因为它把关于几乎所有事物的丰富知识刻进了模型。随后在后训练阶段,模型学习修改这个分布,使其集中到「从问题通向有效答案」的 token 序列上。
所属事件:Fleuret 七连推:LLM 不止预测下一个 token(6 条相关)→
「研究」频道最新
- ICML 2027 程序主席求助:AI slop 投稿爆炸怎么管 — MarkSchmidtUBC · 2026-09-26
- 开源 Jevless:任意带 logprobs 的模型实现 Jev 式结构化决策 — seraphius · 2026-09-26
- 物理博客主披露为 Anthropic 写稿内幕:收费居中水平、拒签 NDA — burny_tech · 2026-09-26
- 论文《Mecha-nudges for Machines》入选 NeurIPS 2026 Spotlight — ethayarajh · 2026-09-26
- AutoScreen 用 AI 智能体重排 CRISPR 结果,湿实验证实癌细胞免疫逃逸基因 — KexinHuang5 · 2026-09-26
- 提示词修一处悄悄毁另一处:输出预算守恒导致无信号回归 — ClickOk5811 · 2026-09-26