Dietterich:预训练阶段已迫使模型抽象泛化,不止鹦鹉学舌
tdietterich · x · 2026-09-25
AI 学者 Thomas Dietterich 在与 @micsolana、Nate Silver 的讨论中反驳「预训练只是鹦鹉学舌」的说法。他指出:
- 预训练阶段逐 token 预测任务本身要求极高,已有证据表明它迫使模型以有趣且有用的方式抽象和泛化。
- SFT 与强化学习则进一步超越语言预测,转向预测正确的多 token 答案。
- 预训练的主要作用是学到良好的内部表示,以及一个能生成候选解的随机生成器。
这是对 LLM 训练各阶段分工的一次简洁技术澄清。
所属事件:Dietterich:LLM不只是预测下一个词,预训练已逼出抽象泛化(2 条相关)→
「研究」频道最新
- AI 蛋白质设计团队获大批 GPU,起重机吊入一吨实验设备 — nlarusstone · 2026-09-25
- FD-Loss 直优化 FID 达 0.75,入选 NeurIPS Oral — yuewang314 · 2026-09-25
- 研究者提出「无魔法 OOD」原则,直指对齐计划通病 — nabla_theta · 2026-09-25
- NeurIPS 2026 论文揭示:无噪声调度的扩散模型暗藏能量景观梯度流 — docmilanfar · 2026-09-25
- AI 科学发现的验证瓶颈:Dario 的基因编辑突破没那么简单 — Ghost_Pilot_MD · 2026-09-25
- AI 博士自述:ICLR 审稿套路化,学术已被工业界甩开 — vykthur · 2026-09-25