开发者推测:新 Opus 靠海量 rollout 把「品味 RL」真正规模化

willcb · x · 2026-09-24

开发者 willcb 提出一个关于新版 Claude Opus 的理论:Anthropic 可能终于把「品味 RL」(taste RL)正确地规模化了——这种信号比常规 RLVR 更噪、更微妙,需要海量 rollout 才能跑出效果;这解释了为什么选择在「较小」的模型上做,且是在拿到更多算力与推理效率提升之后。属未经证实的个人推测,但与社区对新 Opus 训练方式的讨论相呼应。

所属事件:开发者:脏数据训练的模型靠编排审查循环救回(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →