合成数据的重点正在转移:后训练里模拟将比蒸馏更重要
realsohamparekh · x · 2026-09-26
yuhanluo 提出一个正在获得共鸣的后训练观点(获 realsohamparekh 等人转发):
- 合成数据有趣的部分可能不是数据本身;后训练中,「模拟」将比「蒸馏」更重要。
- 蒸馏给模型可以照抄的答案;模拟则为模型建造一个可以折腾的世界(比如一个假用户提出修改要求、一个触发连锁反应的意外事件),让它像真人一样从后果中学习。数据质量现在取决于你的模拟世界与真实世界的贴合程度。
- 判断:蒸馏将在大规模下变成一个推理问题;而模拟是产品+建模问题,仍未被解决。作者兴奋于我们正在「重新发现」某些旧东西。
对做 agent 训练与后训练的人来说,这是一条关于方向性判断的高质量观点。
「研究」频道最新
- InternLM 开源 Intern-Decision 4B/0.8B:一次前向完成结构化决策 — jacek2023 · 2026-09-26
- 斯坦福用哲学概念做预训练:自生成普适事实,Noah Goodman 戏称实现 ASI — xuanalogue · 2026-09-26
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大 — suchenzang · 2026-09-26
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26