模型级安全调优常牺牲可用性,PII 该放在 harness 里

appenz · x · 2026-07-29

作者认为,所谓模型“安全调优”常常是个糟糕的方案:它并不会真正挡住滥用,反而经常先把可用性搞坏。

他举的例子是 PII 保护:这类约束应该放在 harness/外部控制层,而不是塞进模型里做。原因有两点:一是模型在调用时还不知道具体使用场景,二是模型本身仍然可能被“说服”而泄露敏感信息。配图里还能看到模型在“生成含完整 SSN 的 Markdown”这一请求下拒绝并改给模板。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →