预训练与SFT和RL分工

tw_killian · x · 2026-07-10

帖子总结了一个研究假设:预训练负责建立“可能概念”的总体分布,SFT 展示逻辑概念如何被排列,RL 则在面对新上下文、任务和问题时,探索新的概念排序。

所属事件:探秘后训练:SFT与RL如何提升模型推理组合泛化(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →