ALE 基准 11 任务实测:不同 Qwen 规模与 harness 的得分与开销

yb2698 · x · 2026-10-07

作者说明实验设置:在 ALE benchmark 近期 tier 子集的 25%(共 11 个任务)上,跑不同规模的 Qwen 模型和两种 harness(Qwen Code 与 Pi),报告平均 reward 与平均 token 消耗。

该系列帖子旨在量化 harness 对模型性能与行为的影响——这是社区已知的现象,近期多篇工作也指出过。

所属事件:研究者实测 agent harness:框架间工具高度重叠,system prompt 影响显著(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →