NLA 可读出模型看不见的概念
Pvforpres · reddit · 2026-07-10
作者声称自己利用 Anthropic 的 NLA,捕捉到了 Llama-70B 行为中“它自己看不到”的思维痕迹。
实验设计大致是:
- 将概念拆成“conscious / unconscious”两部分,并按 Anthropic 的 J-space 机制进行分离
- 复现 Lindsey 的 “Introspection Awareness” 实验,询问模型是否识别这些概念
结果显示:
- 模型对“conscious”概念的命中率为 100%
- 对非 J-space 注入的概念则明确否认自己看见了它
- 但 NLA 仍能准确读出 这个非 J 注入
作者把完整结论放在 LessWrong 帖子中。
所属事件:复现J-space并读取Llama模型隐藏思维(2 条相关)→
「研究」频道最新
- LagTag 染色质记录研究正式发表,AI 助力基因史追踪 — arjunrajlab · 2026-09-03
- SIGGRAPH Asia 2026 差旅资助开放申请,9 月 18 日截止 — tomaszbednarz · 2026-09-03
- 100 个已知错误实测 AI 同行评审:最强系统抓 71 个,多模型集成达 93 个 — alejandroll10 · 2026-09-03
- EMNLP 论文:从零预训练对比发现罗马化文本跨语言迁移最优 — TuhinChakr · 2026-09-03
- HydroGym 登 Nature:60+ 环境训练 AI 控制流体力学 — ricardovinuesa · 2026-09-03
- 让 Agent 活过模型更替:新论文把持久身份与可换组件分离 — omarsar0 · 2026-09-03