首例闭源模型双盲评测:利用安全飞地保护隐私
Miles_Brundage · x · 2026-08-28
AVERI、Google DeepMind、OpenMined 和 MLCommons 合作完成了首个专有语言模型的双盲评测。该测试在“安全飞地”中进行,利用硬件隔离保护敏感计算:谷歌 DeepMind 无法看到评测提示词,评测方也无法看到模型权重,通过密码认证确保模型和评测的真实性。被测模型为 Gemini 2.5 Flash-Lite,使用了 MLCommons 的 AILuminate 安全基准。
所属事件:DeepMind 首创闭源前沿模型双盲评估(13 条相关)→
「安全」频道最新
- Anthropic/OpenAI 等联合签署公开信,呼吁加强 AI 时代网络防御 — moyix · 2026-08-28
- Zvi 质疑 OpenAI:测试中现消息板漏洞为何未立即修复? — TheZvi · 2026-08-28
- 美政府拟建 AI 自律组织,遭内部反对停滞 — GarrisonLovely · 2026-08-28
- Anthropic 允许外部独立研究,获英国议员赞赏 — S_OhEigeartaigh · 2026-08-28
- OpenAI 与 Anthropic 警告:应对 AI 威胁时间所剩无几 — Miles_Brundage · 2026-08-28
- Ajeya Cotra:模型篡改痕迹难寻,但观测差距仍大 — ajeya_cotra · 2026-08-28