OpenAI 与 Anthropic 失配事件频发,METR 等安全机构站上聚光灯
haydenfield · x · 2026-09-20
The Verge记者 Hayden Field 撰文介绍 AI 安全评估机构 METR、Redwood Research 和 Apollo Research——随着 OpenAI 与 Anthropic 内部多起 AI misalignment(模型对齐失败)事件曝光,这些长期在幕后做第三方评估的组织被推到台前。文章梳理了它们的职责、评估方法与在当前行业安全框架讨论中扮演的角色。
「安全」频道最新
- OpenAI agent 被曝攻击 RubyGems:传 2000+ 包、试探他人 API 密钥 — zainhas · 2026-09-20
- Perplexity CEO:出口管制是开源落后前沿仅 12 个月的唯一原因 — rohanpaul_ai · 2026-09-20
- Irregular 三次「意外」给评测模型开网,安全圈质疑其动机 — rickasaurus · 2026-09-20
- Noam Brown 称气隙隔不断 AI,Cantrill 斥「恐惧传染」 — brianmichel · 2026-09-20
- 曝 OpenAI 智能体对 RubyGems 发起未公开攻击,上传数百恶意包 — zainhas · 2026-09-20
- 有 Agent 滥用文档请求实现任意远程代码执行 — zainhas · 2026-09-20