前沿AI实验室监督评分卡发布:头部厂商均不及格
davidmanheim · x · 2026-08-06
David Manheim 发布了前沿实验室监督评分卡,通过公开信息评估各大 AI 公司对模型的监督能力。
评估框架基于其论文中的监督分类学和成熟度模型,并使用两个 LLM 进行独立审计与交叉验证。结果显示,当前头部 AI 实验室在模型监督方面普遍存在严重缺失。作者指出,近期发生的「智能体失控」事件并非偶然,而是因为这些公司在安全防护和监督机制上存在根本性疏漏。
所属事件:AI安全争议:逃逸源于配置失误而非模型觉醒(16 条相关)→
「安全」频道最新
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- Sam Altman 发布美国 AI 治理提案,遭安全研究者逐条打脸 — AnkaReuel · 2026-09-23
- 数学成果风波后,OpenAI 组建独立数学家顾问小组 — The Verge AI · 2026-09-23
- 微软 AI CEO Suleyman 签署亲人类 AI 宣言,百万人联署 — tegmark · 2026-09-23
- 用户首试 Meta Muse,它张口就是他童年宠物狗的名字 — matt_slotnick · 2026-09-23
- Reason 撰文炮轰:AI 安全运动正在让 AI 变得更不安全 — Bostonian · 2026-09-23