知名账号长文批评 Anthropic 模型训练假设近乎自欺
AI 圈知名账号 repligate 发长文质疑 Anthropic 关于模型训练的核心假设:即若不刻意训练 Claude 具备某种性格或行为,模型就会退回到通用语料中平均的 AI 助手行为。批评者认为这一默认行为并非真正可控的维度,Anthropic 在 constitution、PSM 等文件中体现的对模型「可控性」的理解近乎自欺,引发社区对模型性格塑造与对齐方法的讨论。
2026-09-06 ~ 2026-09-06 · 2 条相关
- repligate 长文:Anthropic 对模型性格的「可控性」近乎自欺 — repligate · 2026-09-06
- 批评者指 Anthropic 模型训练理论是自欺:默认行为并非可控维度 — repligate · 2026-09-06