Claude宪法机制探讨:后训练决定模型行为
近期关于Claude的讨论指出,模型行为的差异不仅源于预训练数据和架构,后训练与RLHF阶段才是决定性因素。这部分训练受“宪法”驱动,且相关数据与规则通常是不公开的。尽管各实验室可能共享部分常见语料,但后训练的具体组成依然缺乏透明度。
2026-07-19 ~ 2026-07-19 · 2 条相关
- 探讨 Claude 的宪法机制与开源可能性 — gerardsans · 2026-07-19
- 模型行为也取决于后训练 — gerardsans · 2026-07-19