20任务×3重复=120次运行:harness对比评测的隐形成本

RelationshipRound711 · reddit · 2026-10-02

作者以 Reef Infra 的配对 harness 对比为例,算了一笔评测账:文档标注的运行次数为 2 × tasks × episoderepeats,即 20 个任务、3 次重复就是 120 个 agent episode——还不算提出候选修改所消耗的调用,而每个 episode 本身可能包含多次模型与工具调用。

要点:

建议:长优化跑之前先用几个代表性 episode 估算成本,再同时决定套件大小和重复次数——提出修改只是工作量的冰山一角。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →