COLM 论文:潜空间推理模型的潜 token 多数可解码,可解释性即正确性信号
sarahwiegreffe · x · 2026-10-07
Sarah Wiegreffe 团队在 COLM 发表 LRM 可解释性研究,分析两个最先进的潜空间推理模型,主要发现:
- 潜 token 常非必需:在逻辑推理数据集上,不用潜推理也能得到几乎相同的最终答案,这可能解释了 LRM 为何不稳定超越显式推理方法,也质疑了先前工作中潜 token 的作用;
- 多数可解码:当潜 token 真的对性能必要时,对正确预测的实例可解码出标准推理轨迹的比例达 65–93%,说明 LRM 大多执行的是可解释的预期解法而非黑箱过程;
- 无需金标也能解码:作者提出一种方法,可从潜 token 解码经验证的自然语言推理轨迹,而无需预先知道标准答案——正确预测多数可找到验证轨迹,错误预测则只有少数;
- 可解释性即信号:能否解码出可验证轨迹本身就是预测正确性的信号。
论文将于 COLM 2026 海报环节展示。
「研究」频道最新
- Workhorse:不用遥操作,从人类演示学全身移动操作,一次通过全自主 — ChongZzZhang · 2026-10-07
- 剑桥 S2PD 论文:高噪声阶段串行计算让视频扩散遵守物理规则 — elliottszwu · 2026-10-07
- 腾讯把 770B 混元压到 214 GiB,混合精度平均仅 2.38 bit — OpeningRock8761 · 2026-10-07
- 博主自建盲测:pplx-decider-1.1 与前沿模型一致率达 95.6% — bo_wangbo · 2026-10-07
- Rust ML 框架 Burn 0.22 发布:模型编辑后重建最快提速 15 倍 — JosephJacks_ · 2026-10-07
- AAAI《AI Magazine》2026秋季刊上线,收录超 20 篇开放获取文章 — FrnkNlsn · 2026-10-07