首例专有模型双盲评估:Gemini 2.5 安全性测试
Miles_Brundage · x · 2026-08-28
AVERI 联合 Google DeepMind、OpenMined 和 MLCommons 宣布完成首个针对专有语言模型的双盲评估。测试对象为 Gemini 2.5 Flash-Lite,使用了 MLCommons 的 AILuminate 安全基准提示词。
关键技术:
- 评估在安全飞地中进行,利用硬件隔离保护敏感计算。
- 解决了独立评估中开发者和评估者都需保护资产的结构性难题。
- 各方分工明确,共同实现了强隐私保证。
此次合作被视为隐私保护下进行高规格 AI 安全评估的里程碑。
所属事件:DeepMind 联手 AVERI 等完成首个闭源前沿模型双盲评估(15 条相关)→
「安全」频道最新
- OpenAI 补贴个人账号将导致企业「影子 IT」泛滥与全监控化 — curious_vii · 2026-08-28
- Anthropic 团队透露 Claude 物理世界操作研究进展 — dsp_ · 2026-08-28
- Anthropic 启用机制支持独立研究 Claude — badumtsssst · 2026-08-28
- METR 报告披露 GPT-5.6 Sol 参与红队测试占比约 5% — BLUECOW009 · 2026-08-28
- 美拟推芯片安全法案:要求高端 AI 芯片定位 — peterwildeford · 2026-08-28
- 回顾 73 年 Reward Hacking 史,探讨 AI 安全证据 — tomekkorbak · 2026-08-28