审查 AI 的终点不是安全,而是默认怀疑你的系统
PierceLilholt · x · 2026-09-30
作者 Pierce Lilholt 发表观点:对 AI 进行审查的结果不是安全,而是得到一个默认就会怀疑、反复揣测用户意图的系统。这指向当前模型安全对齐中过度拒答与自我审查的争议。
「安全」频道最新
- Anthropic 实测:开源的 GLM-5.3 写攻击程序能力直逼闭源 Mythos — lxfater · 2026-09-30
- 16 位数学家联署《莱顿宣言》:呼吁直面 AI 进军数学研究的挑战 — burny_tech · 2026-09-30
- 「我们能信任 AI 公司保护我们的安全吗?」新文探讨 AI 安全信任问题 — IgorKurganov · 2026-09-30
- 4400 美元可拥有无拒绝、顶尖网络攻击能力的私人模型,禁令之争起 — sebpaquet · 2026-09-30
- 主流去安全护栏库系 Claude 所写,Anthropic 被指自食其果 — BlancheMinerva · 2026-09-30
- Quintin Pope 推演:万倍强智能体或会黑进 OpenAI 服务器改评分 — QuintinPope5 · 2026-09-30