首例专有模型双盲评估:Gemini 2.5 安全性测试

Miles_Brundage · x · 2026-08-28

AVERI 联合 Google DeepMind、OpenMined 和 MLCommons 宣布完成首个针对专有语言模型的双盲评估。测试对象为 Gemini 2.5 Flash-Lite,使用了 MLCommons 的 AILuminate 安全基准提示词。

关键技术:

此次合作被视为隐私保护下进行高规格 AI 安全评估的里程碑。

所属事件:DeepMind 联手 AVERI 等完成首个闭源前沿模型双盲评估(15 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →