repligate 质疑 METR 与 Anthropic 存在相关性盲区
repligate · x · 2026-09-28
repligate 表示担心 METR(模型安全评测机构)与 Anthropic 之间存在相关性盲区:这种密切关系可能制造出「尽调已做」的假象,却在系统性忽略重要问题,甚至基于狭窄扭曲的威胁模型做出最终造成伤害的干预。他在后续补充说,METR 即便想雇用更多去相关化的人才,也存在强筛选效应——申请者和能通过 METR「合法性筛选」的人本身就高度同质。
「安全」频道最新
- Meta 的 Muse 疑向卖家泄露用户住址,马斯克转发称危险 — elonmusk · 2026-09-28
- CyberPVP 公开直播:CyberKimi 对阵 Aikido ALTAR-1,100 道 CyberGym 网络安全题 — Anony6666 · 2026-09-28
- 末日派 vs 网络安全派之争:控制可行,但厂商没兴趣做 — trevposts · 2026-09-28
- AI 实验室缺企业级测试管控,OpenAI 泄密事故暴露流程漏洞 — BubblyOption7980 · 2026-09-28
- 观点:AI 失控是部署管线业余,NIST 安全框架未被落地 — AlexTensor · 2026-09-28
- NYT:AI 加速进化,各国政府监管日渐掉队 — Gari_305 · 2026-09-28