willcb:预训练靠玄学调数据,RL 才是硬数学,新方法是中间态

willcb · x · 2026-10-03

AI 研究者 willcb 点评预训练与后训练方法论的反差:预训练的数据配方极其依赖经验直觉,比如「这个网站采样率高是因为感觉不错,顺便重排了元数据」;而 RL 则是硬核数学,例如追踪低精度算子的误差累积、反解 PDE 以消除持续性偏差。他认为真正可扩展的做法介于两者之间:用推理时算力在 teacher 与 student 之间做最优插值,本质就是 MCMC——这也解释了纯 teacher SFT 和朴素的 OPSD 为何根本上有缺陷。

所属事件:研究者称预训练靠直觉调数据而RL是硬数学(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →