新研究:常见可解释性技术对 LLM 行为评估无显著增益

来自 Anthropic Fellows Program 的新论文《Would this change your answer?》提出用反事实可模拟性方法,通过反事实实验评估 LLM 行为解释的有效性。研究针对模型的「野外行为」构建了解释性评估基准,结果显示现有的常见可解释性工具并未带来显著的性能提升,引发对当前可解释性技术实际价值的讨论。

2026-08-22 ~ 2026-08-22 · 2 条相关