爆料讨论:OpenAI 或用合成 CoT 改写内化推理链

cephaloform · x · 2026-09-04

@ueaj 推测 OpenAI 并非在做 looped transformer(也可能是 MoEUT),但 RL 信号密度不足以在极少推理下攻克前沿数学。更可能的做法是对 CoT 做合成改写——改得更精简或直接删掉部分推理,再让下一代预训练做填空,从而把推理模式内化进权重。cephaloform 回应称自己也用过类似技术:为一个 2B GAN 的推理判别器先大量尝试,训练其对尝试的 CoT 做 FiM(fill-in-the-middle),再为金标准答案补全推理,然后在合成链上做 SFT 和 RL。此为未经证实的推测性讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →