Pass@1打平:GPT 6 Astra多次采样表现不敌Fable 5.1

zainhas · x · 2026-09-05

同系列的补充对比:在 Terminal Bench 4.0 上,GPT 6 Astra 与 Fable 5.1 的 pass@1 成绩完全打平,但 GPT 6 Astra 在 pass@k(k>1)多次采样场景下的表现不如 Fable 5.1,说明其多轮尝试的增益空间较小。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →