谷歌试点双盲评估,用加密技术防篡改基准测试

The Decoder · rss · 2026-08-28

谷歌 Deepmind 正首次测试前沿 AI 模型的双盲评估机制。通过 Confidential Space 的加密保护,确保谷歌无法查看测试题目,评估人员也无法查看模型权重。该项目与新加坡 AI 安全研究院合作,使用 Gemini Flash Lite 进行试点,旨在为防篡改 AI 基准测试树立新标准,解决基准测试的信任问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →