Reddit 追问:Qwen3.6-27B 该用预训练、SFT 还是 RL

No-Paper-557 · reddit · 2026-07-27

Qwen3.6-27B 微调怎么选:继续预训练、SFT 还是 RL

一位 Reddit 用户在问:如果要给 Qwen3.6-27B 增加新能力,同时尽量不破坏底座模型已有能力,continued pre-training、SFT/LoRA、reinforcement post-training 到底哪种更合适?

帖子引用了几篇近期论文,核心争议是“遗忘”问题:

发帖者真正想要的是社区里的实测:

这条帖子的价值在于它把“怎么微调才不容易把模型训坏”这个实战问题摆得很清楚。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →