DeepMind 研究员 Trask:用对抗训练反复攻破沙盒,直到无洞可钻
iamtrask · x · 2026-10-08
Google DeepMind 高级研究员、OpenMined 创始人 Andrew Trask 在访谈中提出构建 AI-proof 沙盒的思路:沙盒是「可无限生成训练数据」的任务,非常适合对抗训练——让模型在气隙集群中反复「攻破沙盒→修复→再攻破」,直到没有漏洞,防止模型绕过限制作弊(他提及 Hugging Face 事件作为反面案例)。他还称密码学的长期防御经验可借鉴。
访谈的更大论点:
- AI 终局不会是单个巨型模型,而是数百万个模型按 prompt 组合与路由,质量和价格都能击败任何单一前沿模型——AI 更像 PC 和互联网,而非大型机。
- 批评嵌入式评估者不够独立:实验室只请自己信任的人,讨论了独立评估者的一天、评估机构面临的「evil EAs」批评等治理问题。
所属事件:DeepMind 研究员:AI 未来是百万小模型而非单一巨头(3 条相关)→
「漫话AGI」频道最新
- SFC 设 500 万至 2000 万美元奖,推动前沿 AI 实验室互相安全审计 — AndrewCritchPhD · 2026-10-08
- 数学家沦为 AI 证明审核员?丹尼特之争引爆数学圈角色辩论 — zetalyrae · 2026-10-08
- 微软研究员:AI 数学成果把理论至上推向荒诞极致 — MikePFrank · 2026-10-08
- AI 夺走了我的创作自尊:一位建筑系学生的迷茫自白 — felixgnclvs · 2026-10-08
- AI 投资人:现在的 AI 像 2021 年的 DeFi,别信跑分,信产品 — subinium · 2026-10-08
- 黄仁勋:AI agent 将比人类更会用软件,因为它们记得每个功能 — rohanpaul_ai · 2026-10-08