研究提出「锐化税」:后训练磨利旧技能而非教新能力

Changdae Oh 等研究者(涉及 Meta)提出「Sharpening Tax」概念,探讨后训练究竟是让 LLM 学会新的智能体能力,还是仅强化已有技能。研究实证了「锐化假说」并给出修正:在智能体任务上,预训练模型配上轻量推理 harness 后,虽然 pass@1 远低于 RL 后训练版本,但在足够大的 K 下 pass@K 覆盖更高,说明 RL 后训练以牺牲覆盖多样性为代价换取单次准确率提升。

2026-10-02 ~ 2026-10-02 · 2 条相关