Anthropic 论文:通过反事实提示评估 LLM 行为解释

dl_weekly · x · 2026-08-29

Anthropic 研究团队提出 CHIVE,一个用于发现和解释野外 LLM 行为的代理流水线。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →