Reddit 用户吐槽:Cyber Verified 后 Opus 5.5 仍频繁拦截漏洞复现

hashtagferg · reddit · 2026-10-10

一位获得 Anthropic Cyber Verified 认证的安全研究者发帖称,新模型纳入该计划后体验几乎没变化:只有 Sonnet 4.6 愿意配合,其他模型频繁触发 Cyber 护栏并降级到弱模型。

具体案例包括:

他质疑该计划是否只适用于常规 Web 漏洞,RCE 等高影响问题是否是已知雷区,并对 Cyber Verified 的实际作用感到困惑。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →