小白用 AI 做可解释性研究:称验证指令力呈线性表征
LoudYogurtcloset7856 · reddit · 2026-10-06
一位自认外行的 Reddit 用户让 AI 全程设计并执行了一项 LLM 可解释性研究,试图证明「LLM 不是黑箱」。实验用最小对测试集、线性探针、Direct Logit Attribution、因果激活修补和稀疏自编码器(SAE)检验 5 个假设:
- 指令力线性表征:祈使 vs 陈述的语用差异在残差流中折叠为一维线性子空间,第 1 层即达 100% 探针准确率
- 句法绑定:及物 SVO 结构需要多头注意力混合,探针准确率从第 0 层 72.5% 升至 3-4 层的 90%
- 电路定位:Layer 1 Head 0 被锁定为写入指令性 logit 增益的主注意力电路(Δz=+0.3102)
- 因果转向:第 2 层激活修补 100% 恢复指令决策状态;方向向量可将目标动作 token 概率相对提升约 9.7%
- SAE 解缠:L1 正则 SAE 重构解释方差 99%,256/256 特征全部激活,发现 55 个纯度 ≥80% 的单义特征,如 ILLOCUTIONARYFORCE
作者坦承自己不懂研究,全部由 AI 完成,结果真实性待验证,但展示了「AI 自主跑可解释性实验」的雏形。
「研究」频道最新
- tszzl:对齐要成为工程学科,起码得先攻克机制可解释性 — tszzl · 2026-10-06
- 因果决策研究亮相可信 AI 研讨会,录像已公开 — murat_kocaoglu_ · 2026-10-06
- Claude 突破 3SUM 复杂度下界,给出 O(n^1.9992) 算法附 Lean 证明 — thegautamkamath · 2026-10-06
- ReSteer 开源:修复 VLA 执行中途无视新指令的可控性缺陷 — siddkaramcheti · 2026-10-06
- 研究者携「推理模型潜空间策略状态」解读工作参加 COLM — hunarbatra · 2026-10-06
- COLM 2026 论文:推理微调会在 LLM 潜空间中留下持久策略状态 — hunarbatra · 2026-10-06