repligate 长文:Anthropic 对模型性格的「可控性」近乎自欺

repligate · x · 2026-09-06

AI 圈知名账号 repligate 发长文质疑 Anthropic 对模型训练的核心假设——即「不训练某种性格/行为,模型就会退回通用语料的平均 AI 助手行为」,且 Anthropic 隐含相信自己能随意控制这些维度。

作者认为这与经验证据相悖,理由是:

作者的结论是:性格训练只能「影响」最终形成的东西,而非天真正地「控制」它——就像父母影响孩子的成长,结果常与期望相反。

所属事件:知名账号长文批评 Anthropic 模型训练假设近乎自欺(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →