开发者推测:新 Opus 靠海量 rollout 把「品味 RL」真正规模化
willcb · x · 2026-09-24
开发者 willcb 提出一个关于新版 Claude Opus 的理论:Anthropic 可能终于把「品味 RL」(taste RL)正确地规模化了——这种信号比常规 RLVR 更噪、更微妙,需要海量 rollout 才能跑出效果;这解释了为什么选择在「较小」的模型上做,且是在拿到更多算力与推理效率提升之后。属未经证实的个人推测,但与社区对新 Opus 训练方式的讨论相呼应。
所属事件:开发者:脏数据训练的模型靠编排审查循环救回(2 条相关)→
「模型」频道最新
- Fable 5.1 与 Astra 在 Mensa 挪威测试双双满分 — Chemical-Agency-3997 · 2026-09-24
- 用户实测 MiniMax H3 视频生成,疑似训练数据含 Will Stancil 节目 — Kyrannio · 2026-09-24
- 一句话 62 秒建站花费不足 5 美分,小米 MiMo V2.6 Pro 开源模型实测 — socialwithaayan · 2026-09-24
- DeepMind 新掌门 Koray Kavukcuoglu:Gemini 4 已近完成,年内尽早发布 — The Verge AI · 2026-09-24
- 换一个对话就放行:用户晒出 ChatGPT 生成自我形象的绕过技巧 — Todesluke · 2026-09-24
- 开源复现缺的不是算法是数据:HF 集合整理 Jev 训练评测数据集 — vanstriendaniel · 2026-09-24