红队老炮重提「假设偏见」:AI 安全需要自己的 Assume Breach

wunderwuzzi23 · x · 2026-10-02

安全研究者 wunderwuzzi 引用 arekfurt 的观点:网络安全有「assume breach(假定已被入侵)」核心概念,AI 安全也需要一个类似的「assume misalignment(假定不对齐)」框架。他早在 2020 年的机器学习攻击系列文章中就提出过「Assume Bias」理念,当时列举了 Amazon 招聘 AI 歧视女性、微软 Tay 聊天机器人迅速变毒、IBM 癌症治疗推荐系统被医生痛批等失败案例。

核心主张是:既然网络安全的思路是从「假设系统已被攻破,你怎么办」出发,AI 系统设计者也应接受「你的 AI 有偏见、会做出错误预测,你打算怎么办」这一前提,在架构层面内置缓解、测试、检测与响应(包括下线机制)策略。如今他把这一口号简化为「Trust No AI」,呼应 LLM 时代对模型输出不可尽信的共识。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →