willcb:预训练靠玄学调数据,RL 才是硬数学,新方法是中间态
willcb · x · 2026-10-03
AI 研究者 willcb 点评预训练与后训练方法论的反差:预训练的数据配方极其依赖经验直觉,比如「这个网站采样率高是因为感觉不错,顺便重排了元数据」;而 RL 则是硬核数学,例如追踪低精度算子的误差累积、反解 PDE 以消除持续性偏差。他认为真正可扩展的做法介于两者之间:用推理时算力在 teacher 与 student 之间做最优插值,本质就是 MCMC——这也解释了纯 teacher SFT 和朴素的 OPSD 为何根本上有缺陷。
所属事件:研究者称预训练靠直觉调数据而RL是硬数学(2 条相关)→
「研究」频道最新
- Schmidhuber 甩出三篇论文回应质疑:创造力形式理论早有伏笔 — SchmidhuberAI · 2026-10-03
- Projection sampling:让 SFT 学新能力而不遗忘旧技能的数据变换框架 — burkov · 2026-10-03
- Grok 4.7 在 Cursor 里算出球面巡检最短航线的数值候选解 — xiaosun86 · 2026-10-03
- Pairscore:让 LLM 打分多项比独立评估更能校准不确定性 — yeewhye · 2026-10-03
- willDep 数据:更看好神经符号世界模型而非单 rollout RL — willcb · 2026-10-03
- 38 篇 AI for Science 论文,作者提炼六条科研教训 — bravo_abad · 2026-10-03