首篇预印本:潜空间推理模型默认不可监控,mech interp 可解

TuhinChakr · x · 2026-10-07

研究者 Connor Dilgren 发布其首篇 LM 可解释性预印本,核心问题是:潜空间推理模型(latent reasoning models)不在人类可读的自然语言文本中推理,因此默认状态下不可监控。论文探索能否借助 mechanistic interpretability 取得对其中间推理步骤的理解。该工作将在 COLM 会议现场展示(海报 #136)。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →