Subtext 可视化模型思考中的静默词

TheOnlyVibemaster · reddit · 2026-07-07

Anthropic 发布 J-space / global workspace(全局工作空间)研究:模型内部存在少量涌现的'静默词'(约几十个概念,占激活不足 10%),可基于其推理并报告,已开源 Jacobian lens 测量工具,Neuronpedia 提供 Qwen 的预拟合 lens。作者据此构建 Subtext:在单张 12GB GPU 上以 bf16 运行 qwen3.5-4B,逐 token 读取 9 层 lens,可在模型读取消息和生成回复时实时可视化其内部判断(如读取'12+5=1'时'incorrect'在尚未输出任何回复词时即提前点亮),速度与生成速度持平,并已对照 Anthropic 参考实现逐层验证 top-5 完全一致。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →