NLA 可读出模型看不见的概念

Pvforpres · reddit · 2026-07-10

作者声称自己利用 Anthropic 的 NLA,捕捉到了 Llama-70B 行为中“它自己看不到”的思维痕迹。

实验设计大致是:

结果显示:

作者把完整结论放在 LessWrong 帖子中。

所属事件:复现J-space并读取Llama模型隐藏思维(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →