观点:预训练本质上是全信息反馈的单 token rollout RL
burny_tech · x · 2026-09-27
willcb 提出一个技术性观察:每个 LLM 最初都是随机初始化模型,而预训练在形式上等价于使用单 token rollout、且反馈是全信息(full-information)而非 bandit 式的强化学习。这一类比把监督式下一词预测与 RL 框架统一了起来,引发对预训练与后训练连续性的讨论。
「研究」频道最新
- AtherOMICS 动脉粥样硬化多组学生物银行协议论文登上 Science Advances — anshulkundaje · 2026-09-27
- ENGRAM 真是免费午餐吗?深度拆解 DRAM 卸载嵌入表技术 — bookwormengr · 2026-09-27
- MIT 教材论文写作章节走红:只有好论文才对职业有用 — Haoyu_Xiong_ · 2026-09-27
- 2026 年了,Lean 之外的证明助手还是装不好 — spikedoanz · 2026-09-27
- 阿里开源 Ovis-Embedding:文图音视统一嵌入,MMEB-v3 达 SOTA — solyarisoftware · 2026-09-27
- 语言带宽仅约 56k 调制解调器,模型训练的只是世界的有损残影 — yunta_tsai · 2026-09-27