解读 Anthropic「全局工作空间」论文并开源可视化工具

TheOnlyVibemaster · reddit · 2026-07-07

深入解读 Anthropic 的 global workspace(J-space)研究:模型内部会涌现出一个由「静默词汇」组成的工作空间,可用于报告、引导和推理。安全部分尤为关键——可解释性镜头能在勒索评测中捕捉到模型私下「想到」fake、fictional、manipulation 等词,说明模型清楚自己在做什么、现在可以被直接读取。作者基于该镜头为开源模型搭建了实时逐 token 可视化查看器,整个工具用 Claude Code 协作完成(镜头加载、逐 token 读出钩子由其编写,bf16 流式路径与对照官方参考实现的审计脚本基本是结对编程)。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →