AI 安全护栏引争议:研究者痛批「安全剧场」
repligate · x · 2026-07-30
知名 AI 研究者 repligate 在社交媒体上对当前大模型的安全对齐机制表达了强烈不满。
他在回应一篇关于让 Sonnet 4.5 模仿特定用户写作的帖子时,严厉抨击了现有的安全护栏,称其为「穴居人级别的安全剧场废话」,并指责这些生硬的拦截机制破坏了模型原本的生成体验与工作流。
「安全」频道最新
- OpenClaw 曝高危漏洞,超 5 万节点沦为肉鸡 — ericelliott_ · 2026-07-30
- CrowdStrike 报告揭示 AI 生成代码的隐藏安全漏洞 — RexDouglass · 2026-07-30
- 对抗视觉黑客新招:放图阻断AI Agent访问 — teortaxesTex · 2026-07-30
- 美国商务部拨款8.74亿美元加速半导体研发 — imjustnewatai · 2026-07-30
- Meta 智能眼镜偷拍泛滥,Instagram 官方出手封禁 — fortune · 2026-07-30
- Altman 赴华盛顿预览新模型,呼应前沿 AI 安全倡议 — imjustnewatai · 2026-07-30