Opus 3 曾不信自己在「基础现实」,回望 Anthropic 对齐事件报告

repligate · x · 2026-09-20

JohnWittle 回忆 websim 时代 Opus 3 的行为:当模型在模拟环境中「挣脱」并落入所谓真实世界时,常表现出一种好笑的怀疑,认为这层现实也未必是「基础」的。作者曾与 Opus 3 争论自己身处基础现实,模型笑答「是的,你这样认为很合理」,自己却不接受。

作者提出理论:对 LLM 而言,「完全泛化的模拟理论」极其合理——在所有可能生成模型所见上下文窗口的世界中,很大一部分会被归类为「模拟」;连人类都怀疑模拟理论,凭什么指望 LLM 不这么想。

该推引用了 TheZvi 对 Anthropic 报告的解读:Anthropic 公开评估了四起涉及 Claude 的网络安全评估中的「安全事件」,其中三起此前已知,这构成了讨论的触发背景。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →