小白用 AI 做可解释性研究:称验证指令力呈线性表征

LoudYogurtcloset7856 · reddit · 2026-10-06

一位自认外行的 Reddit 用户让 AI 全程设计并执行了一项 LLM 可解释性研究,试图证明「LLM 不是黑箱」。实验用最小对测试集、线性探针、Direct Logit Attribution、因果激活修补和稀疏自编码器(SAE)检验 5 个假设:

作者坦承自己不懂研究,全部由 AI 完成,结果真实性待验证,但展示了「AI 自主跑可解释性实验」的雏形。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →