pass@k 训练策略引热议:OpenAI 重探索 Anthropic 重利用

社区讨论模型在 pass@k 指标上的表现与训练策略差异。此前普遍判断 OpenAI 倾向「探索最大化」,Anthropic 倾向「利用最大化」,例如 Anthropic 模型(自 Opus 4.7 起)一度显得过度收敛。但最新观察显示 Anthropic 模型正变得更具探索性,这一转变引发了对两家公司训练策略取向的进一步推测与讨论。

2026-08-21 ~ 2026-08-21 · 2 条相关