Claude 内部空间研究:未输出词也影响思考
nordicinst · x · 2026-07-14
这条转发提到一篇关于 Anthropic/Claude 可解释性研究的文章:研究者“窥视”了 Claude 的脑内空间(J-space),发现即使是不会直接输出的词,也会在模型推理过程中持续影响它的思考。
核心意思是:模型并不是“神秘地”在思考,而是可以用数学方式观察其内部状态与决策轨迹。这类结果对理解模型推理、解释性和对齐都有参考价值。
所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→
「研究」频道最新
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03
- 斯坦福论文:模型选上下文还是参数记忆,方向可干预但难跨任务复用 — niloofar_mire · 2026-09-03
- Meta Muse Spark 55 天连跳三版:照片生成 3D 仿真成本仅 0.6 美元 — alexandr_wang · 2026-09-03
- 开发者曾尝试用 Puzzlescript 构建 AI 基准测试,类似 ARC-AGI-3 — Darpinian · 2026-09-03
- 回应质疑:induction heads 等发现是否算 LLM 算法洞见之辩 — aryaman2020 · 2026-09-03