rgblong 回应质疑:关注模型自我呈现矛盾,非罗柯蛇怪式推理

rgblong · x · 2026-09-18

针对 Nina Panickssery「这是不是罗柯蛇怪式推理」的质疑,rgblong 澄清自己的担忧与此无关:他希望看到 Anthropic 路线之外的对齐方案,也部分认同对 Anthropic 方法的安全担忧。他在后续补充中说明,自己关注的是向模型灌输关于意识、目标、自我是否存在等自相矛盾或连贯性缺失的观念所带来的安全风险。

所属事件:前微软研究员警告向模型灌输矛盾意识观有安全风险(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →