用 FiM 模型补全思维链合成 SFT 数据,训练 2B/9B 推理 GAN
cephaloform · x · 2026-09-04
作者分享了一个让模型完成其尚不可靠任务的数据合成技巧,用于训练 2B GAN 的推理判别器:让模型对大量尝试进行采样,用训练好的 FIM(fill-in-the-middle)模型在尝试中补全思维链(CoT),再为一批「金牌」答案填入推理链,然后在合成思维链上做 SFT,再做 RL。
作者还用同样方法处理了 9b 模型,同时作为生成器和判别器:生成器的 SFT 集来自真实文本的 ground truth 补全,推理链由 FIM 模型填充而成。
「研究」频道最新
- Uno 用 AR 架构无损并行采样,速度超 EAGLE-3 全部扩散 LLM — HongyiWang10 · 2026-09-05
- 新方法突破以往自解释训练的窄泛化:未定向训练也提升 hint 评测 — a_karvonen · 2026-09-05
- 从行为调查中生成两类自解释训练目标:反事实预测与开放式解释 — a_karvonen · 2026-09-05
- Anthropic Fellows 训练模型解释自身行为,泛化到未见评测 — a_karvonen · 2026-09-05
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- CoRL 2026 录用结果公布,11 月奥斯汀举办,主办方提醒尽早报名 — yukez · 2026-09-05