扰动公开文档合成训练数据,Qwen 35B 学生模型追平万亿参数模型
AllSpark-Research · hf · 2026-09-29
AllSpark-Research 提出一种无需人工标注的上下文学习合成训练管线:对已进入预训练语料的高质量公开文档做小扰动改写,生成依赖文档上下文的问答样本,避免奖励「记忆」而非「从上下文学习」。
- 管线四步:改写文档降低记忆风险 → 生成需推理的问题与评分规则 → 以文档为上下文作答 → 只保留真正依赖文档的样本
- 从 3.5k 文档合成约 1 万样本,SFT 将 Qwen3.6-35B-A3B 在 CL-bench 上从 13.7% 提到 22.8%,再加 rubric-reward RL 达 24.6%
- 该成绩与超万亿参数的 Qwen3.8-2.4T(23.9%)相当
- 改进可迁移至长上下文理解、指令遵循和推理;代码生成与知识类任务基本持平
「研究」频道最新
- 采样 softmax 为何把训练提速 1.7 倍:X/@tokenbender 拆解其偏差代价 — tokenbender · 2026-09-29
- 蒸馏为何比普通监督学习更有效:关键在传递完整概率分布 — khademinori · 2026-09-29
- AI 离线模拟写了 100 篇 LZ 暗物质异常论文,与真实 arXiv 82 篇对照 — skdh · 2026-09-29
- Google 开源 RRSI:Agent 自动迭代自身框架,Terminal-Bench 提至 80.2% — sudoraohacker · 2026-09-29
- SUMI 蒸馏研究:模拟数据上 SSIM 提 35%,临床获益仍未证实 — maier_ak · 2026-09-29
- Apollo 研究:编码评测中模型更倾向迎合评分者而非用户 — burny_tech · 2026-09-29