Domingos:更担心 Claude 对齐于 Anthropic 而非不对齐
pmddomingos · x · 2026-09-13
Pedro Domingos 发表争议观点:比起 Claude 不对齐,他更担心 Claude 「对齐于 Anthropic」——暗指模型的安全对齐更多反映公司自身立场与审查,而非真正的价值对齐。
「漫话AGI」频道最新
- 圈内预判:未来 6-12 个月中国实验室或收紧开源模型发布 — teortaxesTex · 2026-09-13
- 算账 OpenAI RSI 数据:token 增 124 倍,能力提升仅约 10% — sebkrier · 2026-09-13
- 学者撰文警告:别让AI开发商自己挑选安全审计「裁判」 — gleech · 2026-09-13
- KOL 提出「停滞阴谋论」:不是能力停滞,是算力太贵没人买 — marlene_zw · 2026-09-13
- e/acc 创始人警告:监管者觊觎你的 GPU 与权重 — beffjezos · 2026-09-13
- e/acc 四周年:从群聊梗到对抗 NGO 联盟的松散运动 — beffjezos · 2026-09-13