arXiv 论文:单一指标评估 LLM 鲁棒性会误导,需多层级分析

burny_tech · x · 2026-09-06

论文《How Perturbations Propagate》研究六种自然与合成输入扰动(错字、词序打乱、HotFlip 梯度攻击等)如何在 decoder-only 语言模型的三个层面传播:输出行为、隐状态几何、注意力头功能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →