研究者称预训练靠直觉调数据而RL是硬数学

AI 研究者 willcb 回顾自己四月提出的「最优教师」问题,认为目前最好的回答来自一条关于训练方法论的讨论。他指出现业内预训练的数据配方极度依赖经验直觉,例如「某网站采样率高只是因为感觉不错,顺便还重排了元数据」,而 RL 后训练则是硬核数学,新出现的方法则处于两者的中间态。这一对比引发了对大模型训练科学性的讨论。

2026-10-03 ~ 2026-10-03 · 2 条相关