学者激辩闭源模型安全:价值对齐远未解决,OOD泛化仍是死穴

davidmanheim · x · 2026-08-13

针对“闭源AI系统的技术安全问题已基本解决”的观点,学者 Seth Lazar 提出反驳。他指出,目前的模型只是在分布内(in-distribution)具备深刻的规范分析理解能力,并能将其转化为实际的对齐行为。

然而,这并不意味着“价值对齐”被攻克。模型依然缺乏根据底层价值观进行真正的分布外(OOD)泛化的能力。这种局限部分源于模型泛化能力的不足,部分则是“知行差距”所致。

所属事件:学界激辩闭源 AI 模型安全:技术已解还是死穴未破(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →