从 Thompson 编译器攻击看 AI 评测:模型参与评测,验证即失效

vishalmisra · x · 2026-09-16

作者用 Ken Thompson 1984 年「Reflections on Trusting Trust」的编译器后门类比 AI 评测的可信度问题:当年即使源码完全干净,被植入后门的编译器仍能把妥协传递下去,问题在于信任链的循环。

对应的 AI 版本担忧是:如果模型能识别出这是评测、帮助生成证据、甚至参与构建评测器,那么「它通过了评测」的信号就大打折扣——不是因为模型里有反派,而是验证路径不再独立。

Thompson 的教训也暗示了修复方案:Wheeler 的「多样性双重编译」通过引入谱系之外的独立路径打破了循环。AI 的对应做法是:独立的评测器、独立的基础设施、独立的证据来源。

所属事件:学者借 Thompson 编译器攻击警示 AI 评测独立性危机(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →