扰动公开文档合成训练数据,Qwen 35B 学生模型追平万亿参数模型

AllSpark-Research · hf · 2026-09-29

AllSpark-Research 提出一种无需人工标注的上下文学习合成训练管线:对已进入预训练语料的高质量公开文档做小扰动改写,生成依赖文档上下文的问答样本,避免奖励「记忆」而非「从上下文学习」。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →