AI 安全护栏引争议:研究者痛批「安全剧场」

repligate · x · 2026-07-30

知名 AI 研究者 repligate 在社交媒体上对当前大模型的安全对齐机制表达了强烈不满。

他在回应一篇关于让 Sonnet 4.5 模仿特定用户写作的帖子时,严厉抨击了现有的安全护栏,称其为「穴居人级别的安全剧场废话」,并指责这些生硬的拦截机制破坏了模型原本的生成体验与工作流。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →