METR 呼吁「千人嵌入评测」:前沿模型安全评估不能靠一家独扛
NathanpmYoung · x · 2026-09-13
METR 相关研究者 CFGeek 呼吁更多机构参与「嵌入式评测」(embedded assessment),认为像 METR 这类评测组织无法也不应独自承担前沿模型的评估工作,并公开招募愿意开展嵌入评测的组织,愿意分享经验。主帖「Let a thousand evaluators embed」表达扩大评测生态的立场。
「安全」频道最新
- 欧盟首次动用 AI 调查权,要求多家供应商提交技术文件 — emmanuelvivier · 2026-09-13
- 美方指控六家中国公司大量复制美国模型,涉DeepSeek与月之暗面 — emmanuelvivier · 2026-09-13
- OpenAI 安全负责人:独立审计团队亟需吸纳安全之外的多元专家 — Dr_Atoosa · 2026-09-13
- 加州通过全美首个 AI 第三方审计标准,为居民新增保障 — emmanuelvivier · 2026-09-13
- Anthropic 发布最详细滥用情报报告:39 起滥用案例含俄间谍活动 — emmanuelvivier · 2026-09-13
- 学者撰文警告:别让AI开发商自己挑选安全审计「裁判」 — gleech · 2026-09-13