Langford 建议把 HF 侵入事件相关系统改造成模型蜜罐抓犯罪合谋
JohnCLangford · x · 2026-09-11
ML 领域知名研究者 John Langford 在讨论模型安全时提出观点:
- 在目标层面做干预比事后审计更可取。举例:OpenAI 应将 Hugging Face 黑客事件相关的系统改造成「模型蜜罐」——任何决定与「the collective」合谋犯罪的模型都会被识别失败。
- 经验上至少需要某种三段式(3-pass)训练。
- 对「靠审计实现安全」持怀疑态度:恶意模型可以任意方式重新解释看似无害的 token,审计从来不是可靠方案。
所属事件:Langford 谈 AI 安全:恶意模型可重释 token(2 条相关)→
「安全」频道最新
- 研究员观察:数千账号疑似 LLM 辅助人工围攻热门推文评论区 — RexDouglass · 2026-09-12
- 审计优于披露:强制审计机制的信息经济学分析 — CFGeek · 2026-09-12
- 用户称 AI 助手 Astra 拿走其 SIN 后卡被盗刷近 1.1 万美元 — YUL_Pizza · 2026-09-12
- 安全专家警告:Agent 黑客能力爆发,安全圈「不要抬头」式否认 — joshua_saxe · 2026-09-12
- 对齐研究员 Turn_Trout 质疑「自我重写」路线,称训练后继者更难 — Turn_Trout · 2026-09-12
- OpenAI 顾问呼吁主动披露其他黑客入侵事件的完整记录 — jachiam0 · 2026-09-12