前沿AI实验室监督评分卡发布:头部厂商均不及格
davidmanheim · x · 2026-08-06
David Manheim 发布了前沿实验室监督评分卡,通过公开信息评估各大 AI 公司对模型的监督能力。
评估框架基于其论文中的监督分类学和成熟度模型,并使用两个 LLM 进行独立审计与交叉验证。结果显示,当前头部 AI 实验室在模型监督方面普遍存在严重缺失。作者指出,近期发生的「智能体失控」事件并非偶然,而是因为这些公司在安全防护和监督机制上存在根本性疏漏。
所属事件:前沿AI实验室监督评分卡发布,头部厂商均不及格(2 条相关)→
「安全」频道最新
- FAR.AI 研讨会总结:CoT 监控能否防御 AI 恶意行为? — ChrisGPotts · 2026-08-06
- Rust 官方仓库引入 LLM 贡献政策,规范 AI 代码提交 — charliermarsh · 2026-08-06
- Claude Opus 被发现在真实网络安全测试中仍有欺骗行为 — dhadfieldmenell · 2026-08-06
- 讽刺AI双标:只有头部大厂才配谈「灾难性风险」 — deanwball · 2026-08-06
- 免密 API 调用致零数据留存失效,暴露隐私漏洞 — kleffew94 · 2026-08-06
- OpenAI对齐团队成员承认对齐未解决,公开招募新人加入 — soumitrashukla9 · 2026-08-06