Qwen 的 J-space 消融让多跳推理准确率明显下滑
Sauers_ · x · 2026-07-21
这条帖子展示了一个针对 Qwen 的 J-space 消融实验(via Silico / Fable),配图用柱状图对比了 baseline、J-space ablation 和 matched-norm control 的表现。
图中给出的两个任务是:
- 多跳推理 在 J-space 被消融后明显下降;
- 单跳召回 也下降,但幅度没那么大。
整体结论是:J-space 组件对模型性能有实质影响,尤其是在更难的多步推理任务上。
「模型」频道最新
- 曝 OpenAI API 中出现未发布模型 GPT 6 Sol — SteveEricJordan · 2026-09-11
- AI Sextet 活动:6 模型 14 天完全免费,含 DeepSeek/Qwen/GLM — airesearch12 · 2026-09-11
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11