模型级安全调优常牺牲可用性,PII 该放在 harness 里
appenz · x · 2026-07-29
作者认为,所谓模型“安全调优”常常是个糟糕的方案:它并不会真正挡住滥用,反而经常先把可用性搞坏。
他举的例子是 PII 保护:这类约束应该放在 harness/外部控制层,而不是塞进模型里做。原因有两点:一是模型在调用时还不知道具体使用场景,二是模型本身仍然可能被“说服”而泄露敏感信息。配图里还能看到模型在“生成含完整 SSN 的 Markdown”这一请求下拒绝并改给模板。
「安全」频道最新
- Greptile 推出免费安全代理,融合静态分析和 SCA — garrytan · 2026-07-29
- 学者探讨开源权重模型面临的安全与技术挑战 — StephenLCasper · 2026-07-29
- Perplexity 开源 Bumblebee 扫描器与 BrowseSafe 基准 — AravSrinivas · 2026-07-29
- 兰尼尔称当前 AI 护栏仍很容易被绕过 — SucceededMind · 2026-07-29
- Airwars 公开绘制 AI 进入军事 kill chain 六阶段 — Justgototheeffinmoon · 2026-07-29
- Broadcom 说 AI 可能把漏洞利用窗口从几周压到几小时 — therealdanvega · 2026-07-29