DeepMind 联手多家机构完成首个闭源模型双盲评估
8 月 27 日,Google DeepMind 联合 AVERI、OpenMined 和 MLCommons 宣布达成行业里程碑:首次对专有(闭源)前沿语言模型完成双盲评估,测试对象为 Gemini 2.5 Flash-Lite,评估结果以试点报告形式由 AVERI 发布。该机制在安全飞地中既不向评估方泄露测试提示词,也不暴露模型权重,为闭源模型接受独立可信的第三方评估提供了可行路径。
已确认
- DeepMind 官方宣布试点业界首个针对专有前沿模型的双盲评估机制:测试在安全环境中进行,同时保护测试提示词与模型权重,确保外部安全与性能评估保持私密、稳健和可信,防止模型提前“看到”测试题导致的基准测试污染。
- 合作方包括 AVERI、OpenMined 和 MLCommons;评估采用可信执行环境(TEE)实现权重与提示词的硬件级隔离,并使用 MLCommons 的 AILuminate 安全基准完成测试。OpenMined 创始人 Andrew Trask(@iamtrask)转述称,安全环境通过 OpenMined 的 PySyft 框架创建,并通过加密保证与未受污染的基准测试实现可信评估。
- AVERI 发布了详细描述此次全球首个专有语言模型双盲评估的试点报告。
为什么重要
- 基准测试污染是当前大模型评测领域的核心痛点:模型若在训练阶段接触过评测题目,公开基准的分数便会失真。双盲评估在安全飞地中同时保护提示词与模型权重,兼顾了评估的独立性与模型提供方的商业保密。
- 此举可能推动行业建立新的评测标准:外部研究者无需获得权重访问权限即可对专有模型开展稳健评估。Miles Brundage、Andrew Trask 等 AI 治理领域研究者均转发了这一进展,显示其在 AI 安全与评测社区受到的关注。
2026-08-27 ~ 2026-08-27 · 9 条相关
一手来源
- Google DeepMind 首创前沿 AI 双盲评估机制 — GoogleDeepMind ·
- 【源头】Google DeepMind 首创前沿 AI 双盲评估机制 — GoogleDeepMind · 2026-08-27
- DeepMind 推出双盲评估框架,利用安全飞地防止模型作弊 — Miles_Brundage · 2026-08-27
- 全球首个大模型双盲评估报告:利用 TEE 实现权重与提示词隔离 — Miles_Brundage · 2026-08-27
- 里程碑:首次在安全飞地中双盲评估闭源模型 — Miles_Brundage · 2026-08-27
- MLCommons 完成首个闭源模型双盲评测 — iamtrask · 2026-08-27
- 谷歌首创前沿模型双盲评估,隐藏权重与提示词 — iamtrask · 2026-08-27
另有 3 条近重复转述:HaydnBelfield · iamtrask · iamtrask