让 Claude 不那么「Claude 味」有多难?工程师:最后只好搞语言学

menhguin · x · 2026-09-14

讨论指出 Anthropic 内部显然有人专门负责让 Claude 的语气不那么「Claudeish」,但这几乎无从下手:这种说话风格已深植于预训练样本,甚至其他本不该像 Claude 的模型也会带味,且很难在奖励建模中定义与惩罚——惩罚其支持性/ helpful 的表达方式可能适得其反,还有方差问题。回复者 menhguin 表示方向上可以用 rubric-as-reward,但要定义「Claudeish-ness」需要不伤害有益的 supportive 语气,最后「我简直开始做语言学了」。这是关于模型风格与 RL 训练难点的圈内技术讨论。

所属事件:让 Claude 摆脱「Claude 腔」太难,工程师感叹无从下手(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →