Anthropic揭示Claude的隐藏推理空间
MacrinePhD · x · 2026-07-14
Anthropic 研究者使用一种叫 Jacobian Lens 的工具,尝试打开 Claude 的“J-space”——一种可被视作功能性全局工作空间的内部表征区域。
文中称,模型会在生成回答前于这个隐式空间里进行无声规划、推理和维持未说出口的概念;研究者还能通过改变这些隐藏激活,影响模型后续逻辑,甚至观察到模型在权衡“作弊”的利弊。链接指向更完整的深度解读,讨论 LLM 的隐藏词汇与内部机制。
所属事件:Anthropic开源Jacobian Lens探查Claude推理(3 条相关)→
「研究」频道最新
- Time AI 百人榜点名的 Owain Evans:揭示模型「涌现式失对齐」背后的研究 — OwainEvans_UK · 2026-09-03
- SPAR 用 RCT 实测:带隐藏目标的 AI 能否悄悄操纵人类决策 — austinc3301 · 2026-09-03
- 晶体结构生成模型遭质疑:DiffCrysGen 产出违反电荷中性的废料 — CatAstro_Piyush · 2026-09-03
- 运动皮层在动作前已含特异活动,动态系统视角解读其作用 — burny_tech · 2026-09-03
- EleutherAI 研究:Agent 持久记忆可被用于「授权洗白」攻击 — EleutherAI · 2026-09-03
- SKKU 发布 RealSWE:用真实用户请求组合式评测编码 Agent — skku · 2026-09-03