pass@k 训练策略引热议:OpenAI 重探索 Anthropic 重利用
社区讨论模型在 pass@k 指标上的表现与训练策略差异。此前普遍判断 OpenAI 倾向「探索最大化」,Anthropic 倾向「利用最大化」,例如 Anthropic 模型(自 Opus 4.7 起)一度显得过度收敛。但最新观察显示 Anthropic 模型正变得更具探索性,这一转变引发了对两家公司训练策略取向的进一步推测与讨论。
2026-08-21 ~ 2026-08-21 · 2 条相关
- 讨论模型探索性与 pass@k 指标的关系 — scaling01 · 2026-08-21
- 「OpenAI 探索最大化、Anthropic 利用最大化」:pass@k 训练策略之争 — scaling01 · 2026-08-21