Google DeepMind 推出全球首个前沿模型双盲评估框架

rseroter · x · 2026-08-27

Google DeepMind 引入了针对专有前沿 AI 模型的全球首个双盲评估方法。该方案利用加密的“黑盒”环境,防止模型在测试前提前接触到评估题目(即基准污染问题)。DeepMind 与新加坡 AI 安全研究所、OpenMined 等机构合作,在保护隐私的环境中测试 Gemini Flash Lite 模型,旨在提升模型评估的完整性与可信度。

所属事件:DeepMind 联手 AVERI 等完成首例闭源前沿模型双盲评估(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →