蒸馏有用,但真正起作用的是 SFT 和 midtraining
danielrock · x · 2026-07-22
这条转发在讨论蒸馏(distillation)并不是通往前沿模型的捷径。被引内容强调,蒸馏真正更有价值的环节往往出现在 SFT 和 midtraining 阶段,因为这些阶段更适合把推理行为和某些“思维特征”种进去,而不是简单复制轨迹就能一步到位。
文中还提到,Anthropic 曾表示 DeepSeek 等模型可能在一个 RL 风格的数据管线里使用过其模型,但样本量很小,更像是用于初始化内部模型或做小规模实验,而不是带来决定性的性能跃升。整体观点是:“像 Claude”不等于获得了通往前沿能力的快捷方式。
所属事件:专家澄清强化学习蒸馏:SFT 与中训才是关键(3 条相关)→
「模型」频道最新
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- Anthropic 发布迄今最详尽威胁情报报告:无人机蜂群滥用案例曝光 — soumitrashukla9 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11