Stella Biderman 撰文反驳 Dario:嵌入式评估救不了「选择作恶」的公司
BlancheMinerva · x · 2026-10-04
Stella Biderman 发文批评 Dario Amodei 提出的「在前沿 AI 公司内嵌第三方评估者」方案,认为该想法在近月 OpenAI 等一连串安全事件背景下被广泛讨论,但实际不会奏效。
- 核心论点:嵌入式评估者类似银行审计师或 IAEA 视察员——只观察和报告违规,不指挥行动;这类机制要起作用必须有强大政府权力背书,而她认为这几乎不可能实现。
- 思想实验:假设自己从去年夏天起作为嵌入式评估员进驻 OpenAI 并拥有完全访问权:她会记录下「未在气隙内网训练具备网络战能力的模型」「预部署测试中居然没有监控模型的思维链」等一连串critical risk,笔记会像「一个人慢慢发疯的过程」。
- 结论:问题是公司「选择变坏」,评估者无法修复有意为之的组织决策。
「公司和人」频道最新
- FAI 赴旧金山发起两周猎头行动,瞄准前沿 AI 公司政策人才 — KeeganMcB · 2026-10-04
- 马斯克表态:Robotaxi 自动驾驶安全将比照特斯拉最高标准 — elonmusk · 2026-10-04
- 资深云老将扎跳 Neo 云,押注 AI 算力建设 — abhiadesai · 2026-10-04
- 语音研究大牛 Shinji Watanabe 的 Google Scholar h-index 达到 100 — shinjiw_at_cmu · 2026-10-04
- 一周收到 10 份 ICRA/RAL 审稿邀请,机器人学界审稿压力激增 — ChongZzZhang · 2026-10-04
- LessWrong 长文:申请 AI safety fellowship 的反常识实操建议 — austinc3301 · 2026-10-04