Stella Biderman 撰文反驳 Dario:嵌入式评估者救不了选择作恶的公司
BlancheMinerva · x · 2026-10-09
EleutherAI 研究员 Stella Biderman 发文质疑 Dario Amodei 近期热传的「在前沿 AI 公司内部嵌入第三方评估者」提案,认为这不会起任何作用。
核心论点:
- 嵌入式评估者本质像银行审计师或 IAEA 核查员——只观察和报告违规,不指挥行动;要奏效需要强大的政府权力背书,而这很难实现
- 她做了一个思想实验:假设自己去年夏天作为评估者入驻 OpenAI、拥有完全访问权,笔记将像「一个人慢慢陷入疯狂」
- 列举的「危急风险」包括:OpenAI 并未在气隙隔离的内网上训练具备高级网络战能力的模型,也未在部署前测试中监控思维链,等
她并直言,一年多来对咨询入职工厂建议的回答都是「我认为在 OpenAI 工作不道德」——「押注 OpenAI 做不道德的事,从没人亏过钱」。
「公司和人」频道最新
- 微软 365 家庭版将向全家共享 Copilot AI 权益,但存储砍为共享 2TB — tomwarren · 2026-10-09
- The OpenAI Files再被翻出:回撤利润上限、董事会权力弱化等四大疑点 — AaronBergman18 · 2026-10-09
- 博主翻旧账:Anthropic 公告曾将中国称为"敌对国家" — lxfater · 2026-10-09
- 腾讯混元负责人余一宣布离职,称被有意思的事吸引跳入水中 — oran_ge · 2026-10-09
- OpenAI 回应三名被解雇员工公开信,争议持续发酵 — 141_1337 · 2026-10-09
- 陶哲轩博客刊文:LLM 时代该对数学系学生说什么 — keviv9 · 2026-10-09