预训练靠「感觉」调配方,RL 却是硬核数学?训练方法论之争

willcb · x · 2026-10-03

willcb 回顾自己四月提出的「最优教师」问题,认为他目前见过最好的回答来自一条讨论训练方法论的线程。

他的核心观察是:

作者认为这种「凭直觉的配方」与「严格数学优化」之间的折中路线非常清新,代表了一条介于两者之间的训练方法论中间地带。

所属事件:研究者称预训练靠直觉调数据而RL是硬数学(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →