获批 Claude 网络安全验证计划后仍频繁触发安全护栏,用户困惑
jayprock22 · reddit · 2026-09-11
一位网友称自己几天前被接受进入 Claude 的 Cyber Verification Program(网络安全验证计划),但在讨论获授权的合法网络安全工作时仍不断触发安全护栏,甚至连询问该验证计划本身都会被标记。他质疑:这个计划到底改变了什么?被批准后这样的表现是否正常?
帖子反映了 Anthropic 面向安全研究者的访问计划与模型实际护栏体验之间可能存在的落差,评论区未见官方回应。
「模型」频道最新
- SuperGrok Heavy 用户将抢先体验最前沿功能 — Baconbrix · 2026-09-12
- Qwen3.8-27B 登陆 Cerebras,以极速推理跑出旗舰级成绩 — Scobleizer · 2026-09-12
- Astra 承认质量劣化:实验致 4000-5000 用户受影响,三项问题已修复 — TheMoonMidas · 2026-09-12
- 网友实测称 Gemini V4.1 知识截止疑至 2026 年 1 月 — teortaxesTex · 2026-09-12
- 爆料称谷歌逼近递归自我改进,或赶在 Anthropic 与 OpenAI IPO 前官宣 — beffjezos · 2026-09-12
- 开发者实测称 DeepSeek v4.1 Flash 明显优于 Gemini Flash — gaganghotra_ · 2026-09-12