「OpenAI 探索最大化、Anthropic 利用最大化」:pass@k 训练策略之争

scaling01 · x · 2026-08-21

作者延续此前「OpenAI 在做探索最大化,Anthropic 在做利用最大化」的判断,并给出几点观察与推测:

其引用的原推提出猜想:当 RL 训练算力趋于无穷时,推理模型的 pass@1 应逼近基座模型的 pass@inf(整条曲线抬升);固定算力预算下两者的 pass@inf 差距源于 RL 环境质量——环境越好,越能捕获基座模型能力。

所属事件:pass@k 训练策略引热议:OpenAI 重探索 Anthropic 重利用(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →