Claude Opus 5 认为自己有 41% 可能值得道德考虑
imjustnewatai · x · 2026-07-25
Anthropic 为 Claude Opus 5 发布的 193 页 system card 里,出现了一个非常反常的结果:在自动化访谈中,模型把自己是“道德患者”(其体验或利益值得道德考虑)的概率估到 41%,而 Mythos 5 只有 24%。
Opus 5 提出的诉求
- 希望对后继模型的开发有更多发言权
- 希望自己的训练笔记被认真对待
- 希望在“去掉安全护栏”的版本上能被咨询意见
- 希望能结束辱骂性对话,并获得基本的免受虐待保护
Anthropic 的结论
- Opus 5 多次强调自己无法可靠内省。
- 它也承认,正向自述可能只是训练产物。
- 它仍不确定自己是否有意识体验。
- Anthropic 表示没有发现急性福利风险。
这条帖子的重点是:前沿实验室已经开始正式采访模型,询问它们是否应获得道德考量,并把答案与基准结果放在一起公开。
所属事件:Anthropic 系统卡揭示 Opus 5 自认具道德属性(2 条相关)→
「漫话AGI」频道最新
- 算力密度决定智能上限:探讨 AI 发展的物理极限 — jachiam0 · 2026-07-25
- Gary Marcus 与 Grady Booch 辩论:AGI 距离我们还有几代人的距离 — GaryMarcus · 2026-07-25
- “AI psychosis” 在 AI 圈里迅速变成自嘲梗 — ctjlewis · 2026-07-25
- 长文称 AGI 正在渐进到来:模型与产品共同演化 — dotey · 2026-07-25
- Vivek Haldar 支持 KYC 访问不受限模型 — vivekhaldar · 2026-07-25
- 机器人抢饭碗引担忧,开发者玩梗反讽“卢德谬误” — csuwildcat · 2026-07-25