Reddit 追问:Qwen3.6-27B 该用预训练、SFT 还是 RL
No-Paper-557 · reddit · 2026-07-27
Qwen3.6-27B 微调怎么选:继续预训练、SFT 还是 RL
一位 Reddit 用户在问:如果要给 Qwen3.6-27B 增加新能力,同时尽量不破坏底座模型已有能力,continued pre-training、SFT/LoRA、reinforcement post-training 到底哪种更合适?
帖子引用了几篇近期论文,核心争议是“遗忘”问题:
- Reinforcement Fine-Tuning Naturally Mitigates Forgetting:实验里 SFT 的遗忘比强化微调更严重
- The Role of On-Policy Data in Mitigating Forgetting:在 Qwen 和 Llama 上,on-policy / RL 训练更能保留旧能力
- RL Forgets! Towards Continual Policy Optimization:RL 也会遗忘,所以不是万能解
- Fine-Tuning Without Forgetting via Loss-Adaptive Learning:通过调优化策略,可以明显减少遗忘,论文里还做了 Qwen3 实验
发帖者真正想要的是社区里的实测:
- 有没有直接对比过几种训练路线
- 改进某个领域后,是否牺牲了 coding、reasoning、instruction following、tool use、long context 或通识能力
- 训练参数、前后对照 benchmark 是否完整
这条帖子的价值在于它把“怎么微调才不容易把模型训坏”这个实战问题摆得很清楚。
「研究」频道最新
- 1951 年机械乌龟被拿来解释今天的大模型扩展墙 — mtizard · 2026-07-27
- 便宜存储让 SCD Type 2 显得过时,作者主张改用每日快照 — Zachly · 2026-07-27
- Creed-Bench 发布,专测模型的个人上下文能力 — craighepburn · 2026-07-27
- 研究者发现模型常要经历 a→b→c→d 才学会算术技巧 — dejavucoder · 2026-07-27
- Claude Code 跑长研究项目离不开人类监督 — _akpiper · 2026-07-27
- 阿里 Qwen 下一版应提供多种尺寸,方便可解释性研究 — traviscline · 2026-07-27