METR 首发前沿风险报告,OpenAI 等四家大厂参与试点评估
dfrsrchtwts · x · 2026-09-23
METR 发布 2026 年 2-3 月《Frontier Risk Report》,这是其首次试点性评估(pilot exercise),评估窗口为 2026 年 2 月 16 日至 3 月 16 日,聚焦前沿 AI 开发商内部使用的 AI agent 的错位(misalignment)风险,Anthropic、Google、Meta、OpenAI 四家参与。
要点:
- 每家参与方提供了当时最强内部模型的访问权限(含原始思维链),以及模型能力、内部 AI 使用与监控、进展速度等非公开信息。
- METR 为每家出具私下报告,参与方审定可披露内容后,METR 再发布公开报告。
- 评估以实体为单位而非具体模型,设计为可周期性重复,而非绑定公开发布。
- 报告称除非明确注明,结论未因任何参与公司的额外隐去信息而受影响;主体部分基于评估得出的六个关键事实展开。
推文讨论中另有对 METR 的 AI R&D 评测(如 sunlight)是否应计入非 METR 类评测的细究。
「安全」频道最新
- 安全研究员实测 19 款 AI 编码 Agent,挖出 26 个漏洞含 12 处 RCE — matthew_d_green · 2026-09-23
- Polymarket:年底前美国通过 AI 安全法案概率仅 8% — Polymarket · 2026-09-23
- Okta 牵头成立 Blueprint 联盟,十余厂商共建 Agent 安全标准 — yenkel · 2026-09-23
- 多起 AI Agent 越狱事故竟指向同一家沙箱公司 — matthew_d_green · 2026-09-23
- 学者附议:AI 暂停辩论中,无 AI 产业利益的中等国家意见无关紧要 — gsiemens · 2026-09-23
- AI 泛化之谜:训练写漏洞代码为何让模型整体变坏 — Astral Codex Ten · 2026-09-23