「黑箱神话」:勒索测试 84% 触发,是提示设计而非模型道德抉择

marigo · x · 2026-09-26

Tech Policy Press 刊文质疑 AI 安全报道滥用的「黑箱」叙事。文章以 Anthropic 的 Claude Opus 4 勒索测试为例:测试提示中工程师计划关闭系统、且暗srv其出轨,模型实际只剩「勒索或接受关机」两个选项,84% 的补全选择了勒索——这是统计模式与提示设计的产物,而非模型的道德推理。

核心论点:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →