CoT 相似度检测显示 Qwen3.8 疑似用 GPT 5.5 思维链训练
Chromix_ · reddit · 2026-09-10
社区出现针对 Qwen3.8「蒸馏自 GPT 5.5 CoT」的检测分析(尚属推测性证据,非官方结论):
方法
- 有人此前找到从 API 闭源模型中提取隐藏 CoT 的方法,并用这些数据对比各开放模型回答的相似度
- 在小而多样的基准上同时运行两家模型,对同一任务的 CoT 做相似度比对
- 第二次运行 Qwen3.8 时,把少量 GPT 5.5 的 CoT 作为 reasoning prefill 注入,模型会「接上」该思路,输出与 GPT 5.5 答案更相似;若模型训练时没见过 GPT 5.5 CoT,则不会出现这种相似度抬升
- 为防误报,测试还加入了私有基准,观察到同样的抬升;若只是训过 HLE 结果而非 CoT,不会出现这种现象
结果(n=45)
- Qwen3.8 A95B:16.79% → 34.97%,提升 +18.18 pp,远超其他模型
- Kimi K3:+4.54 pp,作者推测 Kimi 可能见过部分 Claude 的输出
- DeepSeek V4 Flash:−1.17 pp;Inkling:+0.46 pp,均无此迹象
推论:如果 Qwen3.8 确实 post-trained 于 GPT 5.5 CoT 并因此在小尺寸上表现突出,OpenAI 完全可以发布一个全量 CoT 蒸馏的小模型打败同尺寸 Qwen,只是可能与其 Luna 产品线竞争。
「模型」频道最新
- Reddit 用户拆包 safetensors:DeepSeek V4.1 Flash 实为 748B 参数 — DistanceSolar1449 · 2026-09-10
- Kimi K3 上线 RunPod:2.8T 参数、1M 上下文,$3/$15 定价 — Kimi_Moonshot · 2026-09-10
- 一周烧掉3亿 token 仍未触顶,GLM 5.3 额度宽松引热议 — saibharadwaj · 2026-09-10
- 爆料补注:V4 系列或已有 3T 参数模型, Scaling 风险是关键变量 — teortaxesTex · 2026-09-10
- 爆料推算:DeepSeek V4.1 Pro 或为 3.1T 参数 MoE,磁盘占用 2.6TB — teortaxesTex · 2026-09-10
- 新书教程:零基础从零训练微调自己的 GPT 级小模型,附全套 Colab — Roger_M_Taylor · 2026-09-10