ProgramBench 开放自定义模型与 harness 组合上榜
jyangballin · x · 2026-07-25
Meta FAIR、Meta TBD、Stanford 和 Harvard 联合推出的 ProgramBench 现在支持把自定义模型 + harness 组合提交到排行榜。
- 这意味着榜单不再只比固定模型本身,还开始比较模型与执行框架的组合效果。
- 回复里提到,GLM 5.2 在某个任务上平均需要更多轮交互,而 Opus 4.8 用更少轮次就拿到最高分。
- 这条信息的重点是:harness 本身会显著影响表现,并不只是模型单点能力。
「模型」频道最新
- Kimi K3 架构图公开,KDA 和 AttenRes 同时出现 — AccBalanced · 2026-07-25
- 用户称 200 美元 Codex 订阅太值,月付 OpenAI 已达 1200 美元 — robleclerc · 2026-07-25
- 一个 Qwen3.6-27B 合并模型把推理和编程融成 27B — pbaylies · 2026-07-25
- Google 仍索引提到 Claude Opus 5 的 Bedrock 文档 — Angaisb_ · 2026-07-25
- 用户实测 Laguna S2.1:规划太慢,但复杂调试很强 — Prudent-Objective852 · 2026-07-25
- Antirez 反驳“中国前沿模型主要靠蒸馏”说法 — antirez · 2026-07-25