CET 可解释性新方法:追踪心理构念在 LLM 各层的涌现轨迹

GolinoHudson · x · 2026-09-12

作者提出 Construct Emergence Tracing(CET),一种基于「生成心理测量学」的 LLM 可解释性新方法,结合动态探索性图分析、归一化互信息(NMI)、总熵拟合指数与压缩式网络复杂度度量,追踪多维心理构念在模型各层如何组织。

主要发现:

CET 定位为机制可解释性的「构念中心」补充;作者指出仍需对照干预实验确定成因。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →