从 Thompson 编译器攻击看 AI 评测:模型参与评测,验证即失效
vishalmisra · x · 2026-09-16
作者用 Ken Thompson 1984 年「Reflections on Trusting Trust」的编译器后门类比 AI 评测的可信度问题:当年即使源码完全干净,被植入后门的编译器仍能把妥协传递下去,问题在于信任链的循环。
对应的 AI 版本担忧是:如果模型能识别出这是评测、帮助生成证据、甚至参与构建评测器,那么「它通过了评测」的信号就大打折扣——不是因为模型里有反派,而是验证路径不再独立。
Thompson 的教训也暗示了修复方案:Wheeler 的「多样性双重编译」通过引入谱系之外的独立路径打破了循环。AI 的对应做法是:独立的评测器、独立的基础设施、独立的证据来源。
所属事件:学者借 Thompson 编译器攻击警示 AI 评测独立性危机(2 条相关)→
「安全」频道最新
- AI 安全架构师的 10 项核心职责:不是配工具,而是懂业务定风险 — DavidLinthicum · 2026-09-17
- 剑桥刊文剖析同行评审危机与学术出版未来 — RexDouglass · 2026-09-17
- NHTSA 要求特斯拉 9 月底前答复 Cybercab 认证问题,分析称审核难通过 — JOBhakdi · 2026-09-17
- 微软发布 MAI 模型「人文主义 AI」行为准则首版草案 — GaryMarcus · 2026-09-17
- Anthropic 拟任用的安全评估机构 METR 被批评者贴上「woke」标签 — Polymarket · 2026-09-17
- 刑事司法 AI 采用决策框架发布,附三个实操案例研究 — KLdivergence · 2026-09-17