Kokotajlo 质疑开放模型现状:等于最优模型零护栏且无法召回

Afinetheorem · x · 2026-10-01

Afinetheorem(Daniel Kokotajlo)回应 Zeynep Tufekci 时提出一个关于开放模型安全性的反事实论证:如果 OpenAI 对其最强模型完全不设护栏和拒绝机制、且发布后无法召回或修改护栏,人们显然会认为不妥——而开放模型全都已被越狱,这正是当下的实际现状。

他以此反驳对闭源模型安全措施价值的质疑:闭源模型保留的事后干预和下架能力,本身就是开放生态不具备的安全属性。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →