「OpenAI 探索最大化、Anthropic 利用最大化」:pass@k 训练策略之争
scaling01 · x · 2026-08-21
作者延续此前「OpenAI 在做探索最大化,Anthropic 在做利用最大化」的判断,并给出几点观察与推测:
- Anthropic 模型(从 Opus 4.7 起,一度有些过冲)正变得更具探索性;这种探索最大化主要与 RL 相关,而预训练决定 pass@k 性能的基础。
- OpenAI 的探索倾向部分可归因于 Sebastian Bubeck(2024 年 10 月加入,合成数据大师);作者认为从 o3-mini 到 2026 年初能感觉到合成 Phi 模型数据的痕迹,之后明显改善,GPT-5.5/5.6 探索性略有收敛。
其引用的原推提出猜想:当 RL 训练算力趋于无穷时,推理模型的 pass@1 应逼近基座模型的 pass@inf(整条曲线抬升);固定算力预算下两者的 pass@inf 差距源于 RL 环境质量——环境越好,越能捕获基座模型能力。
所属事件:pass@k 训练策略引热议:OpenAI 重探索 Anthropic 重利用(2 条相关)→
「模型」频道最新
- Gemma 模型下载量破 10 亿,社区应用覆盖水下至太空 — osanseviero · 2026-08-21
- 吐槽:用 GPT 构建 Docker 蓝牙音频总管遭拦截 — cargsl · 2026-08-21
- Kimi K3 在复杂表格 OCR 挑战中胜出 — Aron-One · 2026-08-21
- Meta发布Muse Spark 1.2:视觉转代码、机器人导航与视听理解 — AIatMeta · 2026-08-21
- Muse Spark 1.2 多模态能力评测表现强劲 — alexandr_wang · 2026-08-21
- AI 基准是有用还是坏掉了? — sanmikoyejo · 2026-08-21