Kokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回
Afinetheorem · x · 2026-10-01
Afinetheorem(Daniel Kokotajlo)回应 Zeynep Tufekci 时提出一个关于开放模型安全性的反事实论证:如果 OpenAI 对其最强模型完全不设护栏和拒绝机制、且发布后无法召回或修改护栏,人们显然会认为不妥——而开放模型全都已被越狱,这正是当下的实际现状。
他以此反驳对闭源模型安全措施价值的质疑:闭源模型保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。
「漫话AGI」频道最新
- 别低估「编程本身很好玩」在软件业成功中的作用 — sqcai · 2026-10-01
- Sharon Li 将在 IFML 演讲:用 turn 级信号理解 Agent 进步与失败 — SharonYixuanLi · 2026-10-01
- 投资人:AI 时代创业只有“最大化版本”的活法 — adityaag · 2026-10-01
- Stanford 学者回顾 Anthropic 2020 承诺:「第二名也能做安全」 — RishiBommasani · 2026-10-01
- 李飞飞:比起智能爆炸,更该担心的是愚蠢爆炸 — NaveenGRao · 2026-10-01
- 禁开源权重模型挡不住攻击者,却能拦住企业,这正是政策目的 — james_mtc · 2026-10-01