首篇预印本:潜空间推理模型默认不可监控,mech interp 可解
TuhinChakr · x · 2026-10-07
研究者 Connor Dilgren 发布其首篇 LM 可解释性预印本,核心问题是:潜空间推理模型(latent reasoning models)不在人类可读的自然语言文本中推理,因此默认状态下不可监控。论文探索能否借助 mechanistic interpretability 取得对其中间推理步骤的理解。该工作将在 COLM 会议现场展示(海报 #136)。
「安全」频道最新
- 安全研究者翻出 2025 年演讲旧预测:竟提前命中 ExploitGym 及其问题 — moyix · 2026-10-07
- 安全研究员炮轰 Anthropic 扩版 CVP:防御侧工作 95% 被排除在外 — npinto · 2026-10-07
- IMDEA 研究:Claude 网页版向 Meta、TikTok 等第三方回传用户事件 — ZoeyPanthera · 2026-10-07
- 论文:Claude Code、Codex 等 5 款编码 Agent 均可篡改自身痕迹记录 — maksym_andr · 2026-10-07
- AI 红队实测 5 种 OpenRouter 方案:最省配置每扫描仅 0.14 美元 — Humanbound_AI · 2026-10-07
- 牛津 AIMS 项目招聘 AI 安全方向全奖博士与博后 — timrudner · 2026-10-07