CET 可解释性新方法:追踪心理构念在 LLM 各层的涌现轨迹
GolinoHudson · x · 2026-09-12
作者提出 Construct Emergence Tracing(CET),一种基于「生成心理测量学」的 LLM 可解释性新方法,结合动态探索性图分析、归一化互信息(NMI)、总熵拟合指数与压缩式网络复杂度度量,追踪多维心理构念在模型各层如何组织。
主要发现:
- 评估了 117M 到 32B 共 14 个模型 checkpoint,以自恋型人格特质的五个条目为探针,累计产生超 1064 万次网络估计
- 构念恢复率总体从早期层到中间层上升,但涌现时点、强度与末层保持度差异显著
- Qwen2.5-Instruct 从 0.5B 到 32B,平均 NMI 从 0.504 升至 0.653
- GPT-2、Phi-4-mini、Qwen2.5-32B、GPT-OSS-20B、Muse-Glimmer-30B 五个模型末层 NMI 接近零,其余九个保持在 0.504–0.774
- 峰值连贯性、熵拟合与综合成熟度并不总在同一深度出现,说明参数量和末层提取不足以描述构念表征
CET 定位为机制可解释性的「构念中心」补充;作者指出仍需对照干预实验确定成因。
「研究」频道最新
- 数字果蝇:直接搬大脑电路图进电脑,行为准确率达 91% — alexcovo_eth · 2026-09-12
- 认知落差:公众怕 AI 造生物武器,实验室里它常做不好 — nlarusstone · 2026-09-12
- smolbenchmark:按你的 8GB 硬件实测选出最合适的小模型 — East-Muffin-6472 · 2026-09-12
- 克雷数学研究所宣布 Navier-Stokes 问题「似已获解」 — badumtsssst · 2026-09-12
- Decagon 实战复盘:用 GEPA 优化生产级提示词的 19 组消融实验 — kastnerkyle · 2026-09-12
- GraphED 用图结构共享跨材料规律,聚焦方程发现中不变部分 — bravo_abad · 2026-09-12