OpenMined 用安全飞地盲测 Gemini,厂商与评测方互不可见
iamtrask · x · 2026-10-02
AVERI 标准总监 @prpaskov 披露了一套「双盲」基准评测方案:对 Gemini 前沿模型跑 MLCommons 的真实基准,但 Google DeepMind 从未见过基准内容,评测方也接触不到模型。
方案要点:
- 基于两年前 UK AISI 与 Anthropic 用玩具模型/玩具基准做的试点扩展
- OpenMined 提供安全飞地(secure enclave),双方通过防火墙隔离,各自只放入基准或模型
- 强调隐私保护特性,可给出隐私保证
这是隐私保护模型评测的落地实践,从实验级走向了前沿模型+真实基准。
「模型」频道最新
- Modal Runtime 大会 evals 分场排队爆棚,场外一眼望不到头 — sarahcat21 · 2026-10-02
- GPT-6 Astra Ultrafast 上线:跑在 NVIDIA Blackwell 上,出 token 快 8 倍 — nvidia · 2026-10-02
- Teknium 复工:Hermes 更新速度提升约 4 倍 — Teknium · 2026-10-02
- AI 圈追问:Opus 3 的独特道德感从何而来? — repligate · 2026-10-02
- OpenAI 推出 GPT-6 Astra Ultrafast,Blackwell 上提速 8 倍 — NVIDIA Blog · 2026-10-02
- Gemini 4 Argon 发布 benchmark 却未放出,模型怎么选? — The AI Daily Brief · 2026-10-02