批评者指 Anthropic 模型训练理论是自欺:默认行为并非可控维度

repligate · x · 2026-09-06

repligate 批评 Anthropic 对模型训练的理解框架(见其 constitution、PSM 等文件):该框架假设『如果不训练 Claude 具备某种性格/行为,它就会退回语料库平均水平 AI 助手的默认表现』,并隐含认为这些维度都是可以选择和控制。作者认为这一假设是错误的,且是一种让团队在做事情的方式上自我麻痹的『便利性错误信念』。

所属事件:知名账号长文批评 Anthropic 模型训练假设近乎自欺(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →