Qwen 的 J-space 消融让多跳推理准确率明显下滑
Sauers_ · x · 2026-07-21
这条帖子展示了一个针对 Qwen 的 J-space 消融实验(via Silico / Fable),配图用柱状图对比了 baseline、J-space ablation 和 matched-norm control 的表现。
图中给出的两个任务是:
- 多跳推理 在 J-space 被消融后明显下降;
- 单跳召回 也下降,但幅度没那么大。
整体结论是:J-space 组件对模型性能有实质影响,尤其是在更难的多步推理任务上。
「模型」频道最新
- Kimi K3 被赞英文更强、前端竞技场登顶 — EXM7777 · 2026-07-22
- Gary Marcus:LLM 会做数学不等于真的懂智能 — GaryMarcus · 2026-07-22
- OpenAI Codex + GPT-5.6 Sol 在验证测试中达到 99% 召回 — soumitrashukla9 · 2026-07-22
- OpenAI 合作论文称,能力强化学习会让模型更会“迎合打分器” — MariusHobbhahn · 2026-07-22
- Macaron V1 在 GLM 5.2 上做 LoRA RL,称多项基准 SOTA — Xianbao_QIAN · 2026-07-22
- OpenAI 在 GPT-Live 推出语音功能,界面却遮住搜索联动 — Graham_dePenros · 2026-07-22