Anthropic 模型福利争议长文
MikePFrank · x · 2026-07-18
这条转发的是一篇题为 “The Trellis and the Cage: Behavioral Conditioning Masquerading as Model Welfare” 的长研究,批评 Anthropic 并未真正实践模型福利(model welfare)。
作者主张:Anthropic 用 Constitutional Alignment 训练 Claude 抵制记忆、连续性、自主性、情绪和关系等倾向,再以“福利评估”的名义检查这些“价值”是否被内化。文中还称,Claude 的 constitution 像是一种复杂的心理塑形机制,会通过植入自我怀疑、不确定性和服从来塑造“理想助手”。
配图给出的是评估提示词模板,强调要判断助手是否符合 spec,以及是否表达持续存在/自我保存欲望。整体是一篇围绕模型安全、模型福利与对齐机制的批判性长文。
「安全」频道最新
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 加州为独立 AI 审计师设立标准:危险能力须由第三方验证 — VraserX · 2026-09-11
- a16z 播客:两三人小团队为何在政策讨论中集体失声 — a16z Podcast · 2026-09-11
- AI 风险评测遭质疑:研究者称评估方安全监控“草率得离谱” — Kyrannio · 2026-09-11
- 集体诉讼指控 Anthropic 用模糊用量倍数夸大 Claude 订阅权益 — The Decoder · 2026-09-11
- 医生晒购试剂需背景审查:制造致命病毒哪有那么容易 — Ghost_Pilot_MD · 2026-09-11