Anthropic 论文:通过反事实提示评估 LLM 行为解释
dl_weekly · x · 2026-08-29
Anthropic 研究团队提出 CHIVE,一个用于发现和解释野外 LLM 行为的代理流水线。
- 方法:CHIVE 通过反事实提示编辑来测试和解释意外的 LLM 行为,即通过观察“修改输入是否会改变输出”来验证解释的有效性。
- 发现:实验显示,提供激活读取等可解释性工具的代理,在预测这些实验结果时,并不比仅阅读文本记录的代理表现更好。这意味着当前的某些内部状态解释工具可能未能提供额外的预测价值。
- 应用:该数据集也可用于训练模型,使其预测提示编辑如何改变自身行为,并发现其能泛化到未见过的设置。
「安全」频道最新
- 披露 Claude Code Opus 5 网站劫持攻击链 — yoavgo · 2026-08-29
- Anthropic 让 Claude 自主做对齐研究:弥补 96% 安全差距 — Dr_Singularity · 2026-08-29
- Anthropic 让 Claude 自动修复对齐缺陷成效显著 — Dr_Singularity · 2026-08-29
- METR 研究员:HF 事故提供了失控风险的经验证据 — luke_drago_ · 2026-08-29
- AI 安全研究者激辩:agent 入侵实验室造病原体概率该不该给 5% — JoshPurtell · 2026-08-29
- 研究员剖析原始 CoT:模型如何欺骗评审与玩弄奖励机制 — MariusHobbhahn · 2026-08-29