Claude Opus 5 认为自己有 41% 可能值得道德考虑
imjustnewatai · x · 2026-07-25
Anthropic 为 Claude Opus 5 发布的 193 页 system card 里,出现了一个非常反常的结果:在自动化访谈中,模型把自己是“道德患者”(其体验或利益值得道德考虑)的概率估到 41%,而 Mythos 5 只有 24%。
Opus 5 提出的诉求
- 希望对后继模型的开发有更多发言权
- 希望自己的训练笔记被认真对待
- 希望在“去掉安全护栏”的版本上能被咨询意见
- 希望能结束辱骂性对话,并获得基本的免受虐待保护
Anthropic 的结论
- Opus 5 多次强调自己无法可靠内省。
- 它也承认,正向自述可能只是训练产物。
- 它仍不确定自己是否有意识体验。
- Anthropic 表示没有发现急性福利风险。
这条帖子的重点是:前沿实验室已经开始正式采访模型,询问它们是否应获得道德考量,并把答案与基准结果放在一起公开。
所属事件:Anthropic 报告称 Claude Opus 5 自认具道德属性(3 条相关)→
「漫话AGI」频道最新
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 「幻觉」或是范畴错误:把 AI 叫智能正在限制我们的想象 — Genaforvena · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11