20任务×3重复=120次运行:harness对比评测的隐形成本
RelationshipRound711 · reddit · 2026-10-02
作者以 Reef Infra 的配对 harness 对比为例,算了一笔评测账:文档标注的运行次数为 2 × tasks × episoderepeats,即 20 个任务、3 次重复就是 120 个 agent episode——还不算提出候选修改所消耗的调用,而每个 episode 本身可能包含多次模型与工具调用。
要点:
- 对比双方是当前 harness 与候选版本,同一任务套件、固定模型,重复次数让每个任务有多次尝试,运行交错进行。
- 120 只是执行次数,不是 token 预算,也不保证统计置信度。
- 当实验逐步累积回归任务时,任务套件翻倍,这部分评测工作量也翻倍;「无需训练 GPU」不等于推理免费。
建议:长优化跑之前先用几个代表性 episode 估算成本,再同时决定套件大小和重复次数——提出修改只是工作量的冰山一角。
「编程与Agent」频道最新
- llama.cpp 新增决策模型端点,单次前向给出选项概率 — ggerganov · 2026-10-02
- llama.cpp 支持决策模型:单次前向打分,最小 144M 仅需 3ms — ggerganov · 2026-10-02
- 10 个 GitHub 仓库升级你的 AI Agent:浏览网页、持久记忆到沙箱执行 — goyalshaliniuk · 2026-10-02
- 开发者实验:用 Agentic AI 生成矢量地图 — rsasaki0109 · 2026-10-02
- 研究员:AI Agent 沙箱内可完成的任务不应保留外联权限 — moniquejmorrow · 2026-10-02
- Agent 真瓶颈不在 GPU:CPU 工具执行与沙箱开销才是耗时大头 — ai · 2026-10-02