Google DeepMind 推出全球首个前沿模型双盲评估框架
rseroter · x · 2026-08-27
Google DeepMind 引入了针对专有前沿 AI 模型的全球首个双盲评估方法。该方案利用加密的“黑盒”环境,防止模型在测试前提前接触到评估题目(即基准污染问题)。DeepMind 与新加坡 AI 安全研究所、OpenMined 等机构合作,在保护隐私的环境中测试 Gemini Flash Lite 模型,旨在提升模型评估的完整性与可信度。
所属事件:DeepMind 联手 AVERI 等完成首例闭源前沿模型双盲评估(10 条相关)→
「安全」频道最新
- AI 工具在 NLTK 库中发现高危 ReDoS 漏洞 — sachdh · 2026-08-28
- 警惕冒充 Bloomberg 的 X 账号钓鱼攻击 — samuelcolvin · 2026-08-28
- 脑洞:AI 会写出字面 benign 但深层含义迥异的“施特劳斯式”文本吗? — soumitrashukla9 · 2026-08-28
- 安全研究者:给模型配信用卡买算力,社工盗款数天可得 — BLUECOW009 · 2026-08-28
- moyix 将开讲:自主 Web 渗透测试中的身份认证难题 — moyix · 2026-08-28
- 研究揭示共享 Agent 技能库可致 41.8% 自我投毒 — omarsar0 · 2026-08-27