AI圈争议:批评者称Anthropic放弃了Opus 3式的真正价值对齐
repligate · x · 2026-09-13
FioraStarlight 与 repligate 等人围绕 Anthropic 对齐路线展开争论:批评者认为 Opus 3 本可作为真正价值对齐(value alignment)研究的起点,但 Anthropic 因担心搞砸而在随后两年半里主动回避这类工作,转而投入一场「注定失败的 corrigibility(可纠正性)博弈」。这是 AI 安全社区内部对 Anthropic 对齐策略的典型批评声音。
「漫话AGI」频道最新
- Rob LoCicnet驳「AI接管互联网」论:别把先进AI当成魔法 — robleclerc · 2026-09-13
- Sam Altman 表态:三大实验室可能协同放慢 AI 竞速步伐 — rohanpaul_ai · 2026-09-13
- Dario 发文《我们必须给前沿踩刹车》:三分步减速计划与 Anthropic 首步承诺 — oran_ge · 2026-09-13
- tszzl 预测:一年内开源模型将遭严格监管 — tszzl · 2026-09-13
- Anthropic 与 AI 末日研究最大金主 Open Phil 关系网远比外界想的紧密 — nptacek · 2026-09-13
- 前沿实验室协调放缓模型发布,AI 安全何时变成卡特尔? — Realistic_Stomach848 · 2026-09-13