DeepMind 研究员 Trask:用对抗训练反复攻破沙盒,直到无洞可钻

iamtrask · x · 2026-10-08

Google DeepMind 高级研究员、OpenMined 创始人 Andrew Trask 在访谈中提出构建 AI-proof 沙盒的思路:沙盒是「可无限生成训练数据」的任务,非常适合对抗训练——让模型在气隙集群中反复「攻破沙盒→修复→再攻破」,直到没有漏洞,防止模型绕过限制作弊(他提及 Hugging Face 事件作为反面案例)。他还称密码学的长期防御经验可借鉴。

访谈的更大论点:

所属事件:DeepMind 研究员:AI 未来是百万小模型而非单一巨头(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →