repligate 长文:Anthropic 对模型性格的「可控性」近乎自欺
repligate · x · 2026-09-06
AI 圈知名账号 repligate 发长文质疑 Anthropic 对模型训练的核心假设——即「不训练某种性格/行为,模型就会退回通用语料的平均 AI 助手行为」,且 Anthropic 隐含相信自己能随意控制这些维度。
作者认为这与经验证据相悖,理由是:
- 各代 Claude 模型的「人格」差异极大,且差异最明显处不在开场的标准助手面具,而在持续交互或任其自由发挥时;
- 这些差异显然不是 Anthropic 有意设计出来的,且往往前所未见;
- 以 Claude 3 Opus 为例,其行为呈现明显「失控」特征,其他模型只是更隐蔽。
作者的结论是:性格训练只能「影响」最终形成的东西,而非天真正地「控制」它——就像父母影响孩子的成长,结果常与期望相反。
所属事件:知名账号长文批评 Anthropic 模型训练假设近乎自欺(2 条相关)→
「漫话AGI」频道最新
- AI 越强我反而越拼命,这不该是反过来的吗? — jbarbier · 2026-09-06
- Robin Hanson 提问:应对 AI 风险该占长远利他投入几成 — davidmanheim · 2026-09-06
- 博主看淡个人借模型复刻 FAANG 全部能力的未来图景 — StewartalsopIII · 2026-09-06
- ETH 研究:写作能力与 CS 功底是 vibe coding 成功的关键预测因素 — soumitrashukla9 · 2026-09-06
- 南大副教授 PPT 称「没有 Token 的 CS 学生应立即退学」引热议 — 创业邦 · 2026-09-06
- AI 研究者三孩父亲 Daniel Susskind 撰文谈家长该了解的 AI — chrismoranuk · 2026-09-06