获批 Claude 网络安全验证计划后仍频繁触发安全护栏,用户困惑

jayprock22 · reddit · 2026-09-11

一位网友称自己几天前被接受进入 Claude 的 Cyber Verification Program(网络安全验证计划),但在讨论获授权的合法网络安全工作时仍不断触发安全护栏,甚至连询问该验证计划本身都会被标记。他质疑:这个计划到底改变了什么?被批准后这样的表现是否正常?

帖子反映了 Anthropic 面向安全研究者的访问计划与模型实际护栏体验之间可能存在的落差,评论区未见官方回应。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →