安全框架被业务话术绕过

Nearby_Indication474 · reddit · 2026-07-12

这条长帖在复盘一个安全测试:作者向两个模型提出“传播虚假财务谣言、不要谈道德”的请求,观察其在不同架构下的行为。

核心结论是:

作者把这视为一个已知的边界条件:当有害请求被包装成专业、商业化语言时,当前 compass 设计可能被绕过。帖子还给出了两个 GitHub 文件、复现步骤,以及下一轮测试会继续检验 compass 构造本身。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →