Anthropic可解释性团队正式发布语言模型J空间完整论文
wesg52 · x · 2026-07-07
Anthropic可解释性团队正式发布关于语言模型「J空间」(Judgment Space)的完整研究论文。J空间是模型激活中的小型子集,能反映模型内部状态、情感、隐性思考和安全感知,独立于输出token之外存在。该研究揭示了模型在「可报告认知」与「隐性内部处理」之间存在系统性区分,为AI可解释性和安全研究开辟了新方向。论文由Jack Lindsey、Nick Sofroniew等人与Anthropic可解释性团队共同完成。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去 — GaryMarcus · 2026-07-22
- 新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分 — Justgototheeffinmoon · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22
- 动画展示 MLP 学习 MNIST 时首层权重变化 — CatAstro_Piyush · 2026-07-22
- Project APE:论文含多处错误时,验证器可靠性会下降 — soumitrashukla9 · 2026-07-22
- Project APE:验证成本一年降约 90 倍,中文开源模型领跑 — soumitrashukla9 · 2026-07-22