GPT-6与Fable 5.1思维链可控性对比:随长度恶化或系行业通病
博主 1a3orn 于 9 月 4 日发布系列帖子,对比 OpenAI GPT-6(Astra)与蚂蚁 Fable 5.1 的思维链(CoT)可控性数据,结论是:可控性随思维链长度增长而显著下降,且这一现象并非 OpenAI 特有,可能是行业通病。
已确认
- GPT-6(Astra)在约 2k token 的提示长度下可控性约 50%,在 1 万 token 处已不足 10%(原报告图表为对数坐标)。
- Fable 5.1 在约 2k token 时可控性为 50%-65%,1 万 token 时同样不足 10%。
- 1a3orn 指出 Astra 对思维链的掌控比此前模型更强(即可控性更低),但幅度需结合图表判断。
- 对比 Claude 后,Fable 5.1 的可控性高于除 Mythos preview 外的所有模型,且同样呈现随长度恶化的趋势。
尚未确认
- 1a3orn 自己指出原报告图表制作粗糙、难以判读,因此两家模型在 CoT 可控性上的真实差距尚待更清晰的数据确认。
- 他表示 Astra 在某些 CoT 长度上反而"更好"(可控性更低)也说得通,说明具体曲线形态存在解读空间。
为什么重要
- 1a3orn 认为思维链可控性随长度恶化不太可能是 OpenAI 特有的 looped transformation 问题,提示这可能是整个行业在长思维链监督上的共性缺陷。
- 他质疑舆论对 OpenAI 的批判比对 Anthropic 更严厉并不合理,为围绕 GPT-6 的争议提供了对冲视角。
2026-09-04 ~ 2026-09-04 · 6 条相关
一手来源
- GPT 6 长文可控性暴跌:1 万 token 时跌至不足 10% — 1a3orn ·
- 对比显示可控性恶化非 OpenAI 独有,或系行业通病 — 1a3orn ·
- 【源头】GPT 6 长文可控性暴跌:1 万 token 时跌至不足 10% — 1a3orn · 2026-09-04
- GPT-6 思维链可控性引争议,评论称对 OpenAI 批判过头 — 1a3orn · 2026-09-04
- 实测:Fable 5.1 万 token 思维链可控性不足 10% — 1a3orn · 2026-09-04
- 短思维链可控性更高:Fable 5.1 在 2k token 达 50-65% — 1a3orn · 2026-09-04
- GPT-6 思维链可控性数据:2k token 约 50%,1 万 token 不足 10% — 1a3orn · 2026-09-04
- 【源头】对比显示可控性恶化非 OpenAI 独有,或系行业通病 — 1a3orn · 2026-09-04