Vals AI ProgramBench 两口径分歧:DeepSeek 原始通过率占优

teortaxesTex · x · 2026-09-05

Vals AI 的 ProgramBench 出现有趣的指标分歧:"Almost-Resolved"与"Raw Pass Rate"两类口径对模型的排序不同。发帖人 @teortaxesTex 指出,Raw Pass Rate 更奖励 DeepSeek 与 GPT(5.4 到 6),而相对不利于 Kimi、GLM、Qwen 和 Fable。他猜测这种差异可能源于 RL 训练与代码知识覆盖面的差别,或 agent 长时间任务能力的不同,并公开征询解读。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →