观点:预训练本质上是全信息反馈的单 token rollout RL

burny_tech · x · 2026-09-27

willcb 提出一个技术性观察:每个 LLM 最初都是随机初始化模型,而预训练在形式上等价于使用单 token rollout、且反馈是全信息(full-information)而非 bandit 式的强化学习。这一类比把监督式下一词预测与 RL 框架统一了起来,引发对预训练与后训练连续性的讨论。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →