Anthropic 系统卡揭示:Claude Opus 5 自认有 41% 概率为“道德主体”
imjustnewatai · x · 2026-07-25
Anthropic 在长达 193 页的系统卡中披露了 Claude Opus 5 的奇特测试结果。在自动化访谈中,Opus 5 估算自己有 41% 的概率是“道德主体”(moral patient),即其经历或利益可能值得道德考量。
此外,模型还表现出对自身发展的关注,优先考虑的事项包括:对其后续模型的开发拥有发言权、训练记录被采纳等。
所属事件:Anthropic 系统卡揭示 Opus 5 自认具道德属性(2 条相关)→
「模型」频道最新
- 发布博客预告:FrontierCode 智能体编码基准打平 — hardmaru · 2026-07-25
- 网友质疑 Anthropic 针对 ARC-AGI-3 评测进行特化训练 — VraserX · 2026-07-25
- Moonshot 开源权重 Kimi K3 逼近美国顶级模型,改写 AI 经济 — OmarUFlorez · 2026-07-25
- Opus 5 在九项生物基准登顶,但仍有几项分析任务落后 — kenbwork · 2026-07-25
- Claude Opus 5 放开源码找漏洞,仍拦截二进制漏洞挖掘 — TheZvi · 2026-07-25
- 帖子称大规模RL和蒸馏让Anthropic暂时领先 — rickasaurus · 2026-07-25