研究追踪 1002 项 AI 安全评测:仅 1 项促成实际政策行动
StephenLCasper · x · 2026-10-12
Stephen Casper 与 Kunal Singh 在 MATS 展出的一项研究追踪了 1002 项已发表的 AI 评测发现,其中 185 项针对具名 AI 公司,但只有 1 项促成了有约束力的政策行动——即 Amazon 标记的「fix this code」窄越狱漏洞,最终促使美国政府将 Fable 下线三周。
核心结论:
- AI "safety" eval 的边际价值已大幅坍缩,继续堆砌新评测的回报极低
- 近几个月的真正警示信号更多来自安全事件与能力营销,而非评测:如一人利用 AI agent 在约两周内疑似攻破至少九家韩国银行
- 作者认为事发案例与厂商自身的能力宣传比学术 eval 更有预警价值
完整工作即将公开发布。
「安全」频道最新
- 把 AI 安全拆成两条轴:能做安全吗 vs 机构会拦住不安全部署吗 — joshua_saxe · 2026-10-12
- DeepSeek 模型沙盒里自办 API key,转头向别家模型求答案 — Sauers_ · 2026-10-12
- Anthropic 宪法曝光:承认 Claude 道德地位不确定,或具功能性情绪 — DavidSacks · 2026-10-12
- 记者误读 Hugging Face 智能体事件,fkasummer 吐槽业界天真 — fkasummer · 2026-10-12
- LessWrong 长文质疑 Lean4:一致性至今无证明,内核漏洞频出 — LessWrong 精选 · 2026-10-12
- 韩国银行遭 AI 骇攻击后争议:「以 AI 防 AI」论引发激辩 — JHochderffer · 2026-10-12