知名账号长文批评 Anthropic 模型训练假设近乎自欺

AI 圈知名账号 repligate 发长文质疑 Anthropic 关于模型训练的核心假设:即若不刻意训练 Claude 具备某种性格或行为,模型就会退回到通用语料中平均的 AI 助手行为。批评者认为这一默认行为并非真正可控的维度,Anthropic 在 constitution、PSM 等文件中体现的对模型「可控性」的理解近乎自欺,引发社区对模型性格塑造与对齐方法的讨论。

2026-09-06 ~ 2026-09-06 · 2 条相关