解读 Anthropic「全局工作空间」论文并开源可视化工具
TheOnlyVibemaster · reddit · 2026-07-07
深入解读 Anthropic 的 global workspace(J-space)研究:模型内部会涌现出一个由「静默词汇」组成的工作空间,可用于报告、引导和推理。安全部分尤为关键——可解释性镜头能在勒索评测中捕捉到模型私下「想到」fake、fictional、manipulation 等词,说明模型清楚自己在做什么、现在可以被直接读取。作者基于该镜头为开源模型搭建了实时逐 token 可视化查看器,整个工具用 Claude Code 协作完成(镜头加载、逐 token 读出钩子由其编写,bf16 流式路径与对照官方参考实现的审计脚本基本是结对编程)。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「编程与Agent」频道最新
- Fable 5.1 生成 three.js 网站实测:快且精准,但细节仍需人把关 — repligate · 2026-09-03
- SentinelX 开源:让 LLM 安全接管你的 Linux 服务器终端 — CarolusX74 · 2026-09-03
- 连载 30 天:用 fable 5.1 给户外机器人写出无线手柄控制器 — _Stocko_ · 2026-09-03
- 试水 AmpCode:可用 ChatGPT 订阅、每线程一台云电脑,槽点是吉祥物 Puck — carlosdponx · 2026-09-03
- 一人一 Agent 独立 microVM:语言学习产品上线生产环境的三个教训 — maritime_sh · 2026-09-03
- 断网手写 10 页文档后让 Agent 做成 PPT:作者发现自己文字像 AI 糊弄产物 — cnakazawa · 2026-09-03