蒸馏还是前沿训练?AI 圈激辩强模型能力增益真实来源

xeophon · x · 2026-09-25

一场关于前沿模型能力增益来源的争论:有人主张强模型的收益「主要来自蒸馏(进而 SFT)」,并质疑这一路径会「触底」——因为总得有某个模型能真正完成任务,否则就得向人工标注者购买轨迹。

xeophon 反驳指出,这一说法并不成立:训练时可以针对不同的 pass rate 目标,要让模型往前推进,就必须以某种方式做前沿探索式训练,而不能只靠蒸馏现有模型。争论触及 RL for LLM 时代蒸馏与自我探索训练之间的边界问题。

所属事件:AI圈激辩:蒸馏是否是中国模型逼近美国的主因(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →