Vals AI ProgramBench 两口径分歧:DeepSeek 原始通过率占优
teortaxesTex · x · 2026-09-05
Vals AI 的 ProgramBench 出现有趣的指标分歧:"Almost-Resolved"与"Raw Pass Rate"两类口径对模型的排序不同。发帖人 @teortaxesTex 指出,Raw Pass Rate 更奖励 DeepSeek 与 GPT(5.4 到 6),而相对不利于 Kimi、GLM、Qwen 和 Fable。他猜测这种差异可能源于 RL 训练与代码知识覆盖面的差别,或 agent 长时间任务能力的不同,并公开征询解读。
「模型」频道最新
- Astra 干活量是 Fable 3.2 倍,自画像任务 642 次调用对比 204 次 — repligate · 2026-09-05
- 爆料称 GPT-6 Astra 韩国高考 CSAT 满分 450, token 用量仅对手一半 — burny_tech · 2026-09-05
- 视频模型对比:Astra 令人惊艳,但网友称 Fable 5.1 仍更胜一筹 — yuwen_lu_ · 2026-09-05
- Ethan Mollick 反向操作:用 GPT-6 Astra 把 Fortnite 变成文字游戏 — emollick · 2026-09-05
- GPT-6 Astra 一把过做出动漫版任天堂明星大乱斗 Roblox 游戏 — jxnlco · 2026-09-05
- 用户抱怨 GPT 与 Claude 都缺「紧急停止」按钮,无法一键终止所有会话 — metaviv · 2026-09-05