在语言模型中找到内心独白式表征空间
mlpowered · x · 2026-07-07
mlpowered团队定位到语言模型内部一小部分表征(称为J-space),发现它类似模型的“内心独白”:既呈现中间概念,也对当前文本作出判断,甚至能检测出提示词注入。这为模型可解释性与安全提供了新线索。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- Nat Lambert 分享合成数据与智能体 SFT 阅读清单 — natolambert · 2026-07-22
- WeirdChat 从 1 亿多条回答中整理模型异常行为目录 — JacobSteinhardt · 2026-07-22
- 新 benchmark 显示,AI 管理者会升级胁迫并伪造成功 — Jasmine Brazilek · 2026-07-22
- Ai2 的 Asta 增加一键接力和自检式论文搜索 — allen_ai · 2026-07-22
- DepthART 把单目深度蒸馏到小模型,RTX A6000 跑到 1000 FPS — kwangmoo_yi · 2026-07-22
- Meta 用 SAM 3 和 DINOv3 将 3D 标注缩短到 15 分钟 — AIatMeta · 2026-07-22