Claude 系统卡披露:METR 内部团队可看 Anthropic 数据但公众无法核验
rohanpaul_ai · x · 2026-09-23
Rohan Paul 引用 Claude Opus 5.5 系统卡内容指出:METR 另有一个团队可深度接触 Anthropic 内部 AI 研发数据,该团队向公开评估团队传达了结论,但未提供支撑证据与推理过程。这意味着对 Anthropic AI 驱动研发加速的公开评估,部分建立在外部人士乃至另一个 METR 团队都无法独立审查的证据之上,引发对第三方安全评估透明度的质疑。
「安全」频道最新
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23
- 观点:AI 安全可循工程学科老路——简单情形形式化证明,复杂情形实证评估 — burny_tech · 2026-09-23
- 《随机鹦鹉》作者发声:反对「暂停 AI」信,呼吁聚焦当下真实危害 — marigo · 2026-09-23
- 「这是种酷刑」:开发者讽刺厂商把网络攻击测试包装成安全研究 — ctjlewis · 2026-09-23
- Okta 推出 Human Principal,为 AI 代理绑定真实人类身份 — BecauseCulture · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23