Lukas Kaiser 揭秘:清洗模型推理轨迹造合成数据再上 RL
lukaszkaiser · x · 2026-09-26
前 OpenAI 研究者 Lukas Kaiser 回应 Yoav Goldberg 对推理模型训练的困惑:训练流程大体已知,关键在于海量合成数据——取大量模型推理轨迹,让另一个模型进行清理和总结(配合大量人工提示、领域知识和过滤),再用这些数据训练,然后继续跑 RL。这解释了高质量推理轨迹与人类语言论证对齐的来源。
所属事件:Goldberg 等学者激辩:前沿模型超长推理链从何而来(10 条相关)→
「模型」频道最新
- Arena 一分钟周报:GPT-6 Sol 与 Opus 5.5 同周登场 — arena · 2026-09-26
- Pro 用户吐槽:ChatGPT 每轮对话都把模型重置回 gpt6 — No_Scratch9306 · 2026-09-26
- 用户称 Codex 内 Astra 一周内变笨,Opus 5.5 重回王者 — sterlingcrispin · 2026-09-26
- 中国电信星辰 4.0 上架 HF:29B MoE、昇腾 910C 全程训练 — AdinaYakup · 2026-09-26
- 博主吐槽:'Anthropic 杀死 OpenAI'只是一周一个的舆论轮回 — TheMoonMidas · 2026-09-26
- Kev 4B 对比 Jev:精度打平,但 Jev 每次请求多算 257 个 token — facethef · 2026-09-26