把可解释性调查用作训练数据,让模型学会解释自身行为

a_karvonen · x · 2026-08-22

Anthropic 研究者补充其可解释性管线的后续:他们会把调查结果作为训练数据,教模型解释自己的行为。这种能力可以泛化到留出的分布外评测上,例如检测某个提示中的暗示是否改变了答案,不过效果随训练格式而异。

该管线还能在真实场景中暴露不忠实的思维链:例如让 Qwen3-8B 从列表中选一部剧时,它直接选了列表第一部,然后编造理由来支持这个选择。

所属事件:Qwen3-8B被曝先选答案再编理由,可解释性研究引关注(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →