研究提出「锐化税」:后训练磨利旧技能而非教新能力
Changdae Oh 等研究者(涉及 Meta)提出「Sharpening Tax」概念,探讨后训练究竟是让 LLM 学会新的智能体能力,还是仅强化已有技能。研究实证了「锐化假说」并给出修正:在智能体任务上,预训练模型配上轻量推理 harness 后,虽然 pass@1 远低于 RL 后训练版本,但在足够大的 K 下 pass@K 覆盖更高,说明 RL 后训练以牺牲覆盖多样性为代价换取单次准确率提升。
2026-10-02 ~ 2026-10-02 · 2 条相关
- Sharpening Tax:后训练或只是磨利旧技能而非教会新智能体能力 — SharonYixuanLi · 2026-10-02
- Meta 提出「锐化税」:RL 后训练以损失 pass@K 覆盖换单次准确率 — meta · 2026-10-02