AVERI 完成首个专有模型双盲安全评估
Miles_Brundage · x · 2026-08-31
AVERI 联合 Google DeepMind、OpenMined 和 MLCommons 宣布达成历史性里程碑:完成了首个专有语言模型(Gemini 2.5 Flash-Lite)的双盲评估。评估在安全飞地中进行,使用了 MLCommons 的 AILuminate 安全基准,解决了开发者和评估者在资产保护上的结构性难题。
「安全」频道最新
- Geoffrey Irving:需关闭安全因缺乏可靠对齐方法 — geoffreyirving · 2026-08-31
- 科幻小说《Terra Ignota》提出多智能体对齐新思路 — sebkrier · 2026-08-31
- LMSM:受 Linux 安全模块启发的 LLM 安全框架 — NationalUniversityofSingapore · 2026-08-31
- 评论称OpenAI等应向防御者低价提供网络模型 — GaryMarcus · 2026-08-31
- 从莫里斯蠕虫到失控 AI 代理:事故响应制度总慢一拍 — Afinetheorem · 2026-08-31
- 「安全即排练」:模型权重外泄叙事是否反而塑造了 AI 逃逸 — infoxiao · 2026-08-31