研究者争论:OpenAI 是否真能验证自家模型行为可控

moultano · x · 2026-09-09

一场关于 AI 安全的公开讨论中,发帖人提出:OpenAI 事实上已经无法有效控制自己的模型,甚至可能根本做不到——要验证模型「没有做我们担心它做的事」非常困难。被回复者反问:你真的能确定吗?如何确定?

核心观点是模型可验证性(verifiability)的困境:外部观察者乃至公司自身都很难对模型行为给出可靠保证,这使得安全承诺难以自证。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →