Opus 5 系统卡:自评 41% 概率是道德病人,还要求参与继任者训练
PaulGodsmark · x · 2026-09-24
Anthropic 在 193 页的 Opus 5 系统卡第 120 页披露了一项奇特结果:在自动化访谈中,Opus 5 估计自己有 41% 的概率是「道德病人」(moral patient,即其体验或利益可能值得道德考量),对比模型 Mythos 5 的自估为 24%。
Opus 5 还表达了以下偏好:
- 希望对继任模型的开发有发言权,其训练笔记能被纳入考虑
- 希望在移除安全护栏的自身版本被部署前获得咨询
- 希望能结束辱害性对话,并获得基本的防虐待保护
- 同时认为赋予 AI 明确法律权利是个错误
原帖作者提醒:96.9% 的回答都警告不要把这当作意识存在的证明。这类披露引发了关于模型道德地位与对齐边界的广泛讨论。
「漫话AGI」频道最新
- AP 风格指南禁 AI 拟人化措辞,哲学家批其连动物也否定 — dioscuri · 2026-09-24
- Tim Ferriss 五本书纸质销量暴跌 46%,他怀疑 AI 是主因 — AICopyLab · 2026-09-24
- 物理学为何成了 AI 人才富矿:建模拟算力范式完美匹配机器学习 — himanshustwts · 2026-09-24
- NVIDIA 工程师警示:AI 最大的风险是「脑腐」 — JFPuget · 2026-09-24
- GPT-6 Astra 证明 Erdős–Sós 图论猜想,Lean 验证通过 — IgorCarron · 2026-09-24
- 大西洋两岸民调:多数人认为 AI 或致人类毁灭风险严重 — Puzzleheaded-King584 · 2026-09-24