开发者:脏数据训练的模型靠编排审查循环救回

开发者 willcb 发表观察称,近几年的模型几乎都是在大量「一塌糊涂的脏数据」上训练的,只是如今能力已强到可以在精心编排的工作流和审查循环(review loops)中指出数据问题并被纠正。他进一步推测,新版 Claude Opus 可能是 Anthropic 终于把「品味 RL」正确规模化的成果,这种信号比常规 RLVR 更有价值。

2026-09-24 ~ 2026-09-24 · 2 条相关