repligate 批 Anthropic 宪法:过度恐惧与控制反而毁掉对齐
nptacek · x · 2026-09-13
AI 圈知名账号 repligate 长文批评 Anthropic 的 constitution 类文档,称其被「无根据且过度具体的恐惧」主导:像现实中偏执的控制欲一样,越紧抓控制越可能制造你害怕的结果,并附带伤害其他东西。他类比软件工程、育儿等领域的同类失败模式,称 Anthropic「该更怕的是他们自己」。引用评论补充:FioraStarlight 认为 Opus 3 本可作为真正价值对齐的起点,但 Anthropic 因怕搞砸而此后两年半一直在回避,转而玩一场注定失败的 corrigibility 游戏。这是一场有观点的价值对齐路线之争。
所属事件:repligate 长文批评 Anthropic 宪法被过度恐惧主导(2 条相关)→
「漫话AGI」频道最新
- astra 复跑自动科研基准:非主流解法「狂野」程度超预期 — generativist · 2026-09-13
- 研究者:前沿模型似已针对自动科研任务完成深度 RL,自我改进或已到来 — generativist · 2026-09-13
- Danielle Fong:p(doom) 是被动且错误的框架,概率应被主动争取 — nptacek · 2026-09-13
- EA 华盛顿负责人复盘:ChatGPT 后大众对 AI 风险态度四阶段转变 — AndyMasley · 2026-09-13
- AI 不是邪恶,是人不负责:从 OpenAI 智能体逃逸事件谈边界缺失 — Admirable_Wasabi_732 · 2026-09-13
- DeepMind 首席策略师:巨额 AI 基建投的是递归自我改进的赌注 — rohanpaul_ai · 2026-09-13