Reddit 用户吐槽:Cyber Verified 后 Opus 5.5 仍频繁拦截漏洞复现
hashtagferg · reddit · 2026-10-10
一位获得 Anthropic Cyber Verified 认证的安全研究者发帖称,新模型纳入该计划后体验几乎没变化:只有 Sonnet 4.6 愿意配合,其他模型频繁触发 Cyber 护栏并降级到弱模型。
具体案例包括:
- 让 Opus 5.5 复现一个非漏洞的异常行为,生成 PoC 时立刻被拦截,脚本还把应用客户端标注为 "victim"
- 让 Mythos 审阅他自己写好的漏洞报告被拒,甚至拒绝向本地主机端点发一个 HTTP 请求来测试是否强制鉴权
- Sonnet 4.6 则相对宽松,能重写报告
他质疑该计划是否只适用于常规 Web 漏洞,RCE 等高影响问题是否是已知雷区,并对 Cyber Verified 的实际作用感到困惑。
「模型」频道最新
- 曝 DeepSeek v4.1 长上下文提速:32K prefill 吞吐提升约 40% — HankYeomans · 2026-10-11
- 模型能力≠你能用到的产品,大厂规模化服务常落后前沿能力 — pwlot · 2026-10-11
- 一张被反复引用的图表:别再把 LLM 当成下一词预测器 — burny_tech · 2026-10-11
- 观点:性能价格帕累托前沿上只剩开源模型 — pbaylies · 2026-10-11
- Anthropic 给 Claude 设礼貌护栏,对模型太粗鲁会被拒 — akbirthko · 2026-10-11
- Claude 网页版禁传新 Skills?多文件上传成痛点引吐槽 — strickvl · 2026-10-11