arXiv 论文:单一指标评估 LLM 鲁棒性会误导,需多层级分析
burny_tech · x · 2026-09-06
论文《How Perturbations Propagate》研究六种自然与合成输入扰动(错字、词序打乱、HotFlip 梯度攻击等)如何在 decoder-only 语言模型的三个层面传播:输出行为、隐状态几何、注意力头功能。
- 在 4 个 GPT-2 与 2 个 Qwen2.5 检查点上,用 CKA 与内在维度做逐层几何分析,并在 GPT-2 中考察注意力头响应。
- 不同扰动类型产生可区分的度量特征,输出指标无法完全捕捉,且跨检查点不完全一致;复制分数与词替换/打乱下的 activation-patching 恢复显著相关。
- 梯度引导的 HotFlip 扰动比等强度随机替换造成更强的行为与表征破坏,且该行为效应在全部 6 个检查点上一致。
- 结论:仅凭单一行为或表征指标下鲁棒性结论可能误导,应做多层级评估。
「研究」频道最新
- 斯坦福 cs336 课程致谢 NoPE 位置编码研究 — xhluca · 2026-09-06
- 1.5B 小模型实测:来源分级验证让本地 Agent 不再「自信地错」 — UzairArain554 · 2026-09-06
- MasonKamb 抛争议观点:梯度下降是 LLM 与人类认知分歧的原罪 — _arohan_ · 2026-09-06
- Chris Potts 讲解隐学习与可解释性:IPAM 研讨会演讲开放观看 — ChrisGPotts · 2026-09-06
- Prove2Me 走红:支撑 Anthropic 形式化费马大定理的众包平台 — burny_tech · 2026-09-06
- 因果基础模型来了:预训练一次,上下文学习估算因果效应 — burny_tech · 2026-09-06