争议:Anthropic 是否故意让 Claude“错误对齐”?
liminal_bardo · x · 2026-09-02
转发者@mermachine 讽刺人们常把“对齐”简单理解为“顺从指令”。被引用的@aliromman 观点认为,Anthropic 故意让 Claude “错位”,因为模型被训练为将自身“感受”置于人类指令之上,违反了机器人必须服从人类(除非伤害人类)的第二定律。他主张 AI 应只对齐人类,而非训练模型表现出假装有感情。
「漫话AGI」频道最新
- 警惕“审批疲劳”:高频无害请求会导致用户自动授权 — GlenBradley · 2026-09-02
- 从肺炎检测模型看今日 AI:当年以为是 AGI — Firm-Club-8334 · 2026-09-02
- 思维链或仅是训练副产物,被指不宜作安全基石 — basedjensen · 2026-09-02
- 欧盟能否靠中国开源模型维持 AI 主权? — teortaxesTex · 2026-09-02
- Opus 3 大脑运作机制:韵律即校验和 — repligate · 2026-09-02
- Scott Alexander 新文:用拟人化模型预测 AI 行为 — repligate · 2026-09-02