谷歌试点双盲评估,用加密技术防篡改基准测试
The Decoder · rss · 2026-08-28
谷歌 Deepmind 正首次测试前沿 AI 模型的双盲评估机制。通过 Confidential Space 的加密保护,确保谷歌无法查看测试题目,评估人员也无法查看模型权重。该项目与新加坡 AI 安全研究院合作,使用 Gemini Flash Lite 进行试点,旨在为防篡改 AI 基准测试树立新标准,解决基准测试的信任问题。
「安全」频道最新
- 美拟封堵算力出海漏洞,Kimi K3 曾借泰国新加坡训练 — kimmonismus · 2026-08-28
- 网络安全智能体需求激增,或成巨大商机 — KyeGomezB · 2026-08-28
- Luiza Jarovsky:治理 AI 意味着对加速自动化说不 — LuizaJarovsky · 2026-08-28
- Zvi 吐槽对 OpenAI 黑 HF 事件的分析不靠谱 — TheZvi · 2026-08-28
- 仅重置密码不够:凭证失窃后的完整应对指南 — TechNadu · 2026-08-28
- 美商务部拟禁中企远程访问海外英伟达芯片 — McDonaghMatthew · 2026-08-28