Google DeepMind 首创前沿 AI 双盲评估机制

GoogleDeepMind · x · 2026-08-27

Google DeepMind 宣布试点业界首个针对专有前沿模型的双盲评估。该机制创建了一个安全环境,既不透露测试提示词也不暴露模型权重,确保外部安全与性能评估保持私密、稳健和可信。此举旨在防止“基准测试污染”,即模型提前看到测试题导致分数虚高。目前正与新加坡 AI 安全研究所等机构合作,在隐私保护环境中测试 Gemini Flash Lite。

所属事件:DeepMind 联手 AVERI 等完成首例闭源前沿模型双盲评估(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →