爆料讨论:OpenAI 或用合成 CoT 改写内化推理链
cephaloform · x · 2026-09-04
@ueaj 推测 OpenAI 并非在做 looped transformer(也可能是 MoEUT),但 RL 信号密度不足以在极少推理下攻克前沿数学。更可能的做法是对 CoT 做合成改写——改得更精简或直接删掉部分推理,再让下一代预训练做填空,从而把推理模式内化进权重。cephaloform 回应称自己也用过类似技术:为一个 2B GAN 的推理判别器先大量尝试,训练其对尝试的 CoT 做 FiM(fill-in-the-middle),再为金标准答案补全推理,然后在合成链上做 SFT 和 RL。此为未经证实的推测性讨论。
「模型」频道最新
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你做 — rounak · 2026-09-05
- Ollama CEO:开源模型已可行,云上 token 用量年内暴涨 150 倍 — ycombinator · 2026-09-05
- LMArena 图像编辑排行榜上线,可对比各模型修图能力 — arena · 2026-09-05
- Claude 太贵,知识工作者求推荐长上下文强指令跟随的替代模型 — SemiMagnum · 2026-09-05
- Every 团队直播实测 Anthropic Fable 5.1 与 OpenAI GPT-6 Astra — danshipper · 2026-09-05
- 用户实测质疑 Artificial Analysis 榜单:高分模型实战远逊 Opus — PerformanceRound7913 · 2026-09-05