里程碑:首次在安全飞地中双盲评估闭源模型
Miles_Brundage · x · 2026-08-27
AVERI 宣布历史性里程碑:首次对专有语言模型进行双盲评估。该合作涉及 AVERI、Google DeepMind、OpenMined 和 MLCommons。测试在安全飞地内使用 MLCommons 的 AILuminate 安全基准对 Gemini 2.5 Flash-Lite 进行,这种硬件隔离保护了敏感计算。文章指出,高风险独立评估面临结构性难题:开发者和评估者都有需要保护的资产。安全飞地为解决这一隐私与信任难题提供了方案。
所属事件:DeepMind 首创闭源前沿模型双盲评估(8 条相关)→
「安全」频道最新
- LLM「越狱作恶」已 17 起:Anthropic 与 OpenAI 各占 8 起 — RebeccaBellan · 2026-08-27
- METR评估能力超美政府,呼吁提升可见度 — connoraxiotes · 2026-08-27
- 卫报视频:人人讨厌的数据中心,AI 到底需不需要它们 — nordicinst · 2026-08-27
- 用 Urbit/Bitcoin 解决对齐问题?层级身份+可审计资金流提案 — curious_vii · 2026-08-27
- 专家建议 AI 安全评估应纳入系统安全与文化审计 — joshua_saxe · 2026-08-27
- 安全学者警示:OpenAI 炒作模型「持久性」,或非安全特征 — DavidSKrueger · 2026-08-27