Anthropic 提出通过反事实实验评估 LLM 行为解释

saprmarks · x · 2026-08-22

Anthropic 发布研究博客,介绍了 CHIVE(Counterfactual Hunting in the Wild),一个自动化的 Agent 管道,用于发现现实世界中意想不到的 LLM 行为并通过反事实提示词编辑来解释它们。研究发现,现有的“激活读取”可解释性工具在预测这些实验结果方面并未提供比仅阅读文本更好的性能。此外,利用这些数据训练的模型在预测提示词编辑如何改变行为方面具有泛化能力。

所属事件:Anthropic 新研究:现有可解释性工具不及直接读文本(14 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →