可解释性工具受挫:不如直接阅读转录文本

a_karvonen · x · 2026-08-22

研究测试了三种在先前审计游戏中成功的基于激活的工具:激活预言机、自然语言自编码器和SAE。结果显示,在诊断原因和预测提示编辑结果的任务中,这些工具均未击败直接阅读对话文本。该结果在不同超参数、提示词和Fable目标循环下均表现稳健。

所属事件:可解释性工具受挫:诊断Agent时不如直接读对话文本(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →