Claude Code 放行对抗测试,Codex 却拒绝了

random_walker · x · 2026-07-27

这条帖子的核心是:Claude Code 接受了对 Pangram 的对抗性测试,而 Codex 拒绝了。

作者认为,这未必代表两家公司有本质不同的政策,更可能是模型在“模糊边界”上的个体差异,尤其当模型需要推断用户真实意图时会出现不同反应。帖子进一步强调了一个长期观点:AI 安全并不是单纯的“模型属性”,因为拒答行为会随上下文和意图判断而变化。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →