15 种 harness 测 Fable 5.1 全同结果:作者称 harness 不重要
airesearch12 · x · 2026-09-18
- 作者 @xeophon 称用 15 种不同的 harness 跑同一个 "Hello World" 任务,模型为 Fable 5.1,并全程用满 Claude Max x20 的最高档速率限制。
- 所有 harness 得到的结果完全相同,作者因此得出结论:harness 本身对结果没有影响。
- 主帖者追问对方到底烧掉了多少 Claude Max x20 限额,侧面说明该实验成本不低。
这是一个非正式的单任务小实验,结论(「harness 不重要」)样本极小,但引发了关于 agent harness/脚手架是否影响模型输出的讨论。
所属事件:15 种 harness 跑同一任务结果相同引评测之争(2 条相关)→
「编程与Agent」频道最新
- 每天撞 Claude 用量上限?15 个省 token 技巧,单次修复省近 2 万 — goyalshaliniuk · 2026-09-18
- vibe coding 造出 5 万行 PR,但没人能验证它们真能跑 — srchvrs · 2026-09-18
- EMNLP 新论文 AutoData:用 Agent 搜索最优预训练数据选择 — ChengleiSi · 2026-09-18
- Wright 智能体开跑:MCP 连通 CAD/CAE 软件,一句话建模仿真 — burhop · 2026-09-18
- 抓取失败怎么办?实拍 Perplexity agent 的 JS 渲染降级策略 — gaganghotra_ · 2026-09-18
- Noam Brown:agent 集群对纳维-斯托克斯发现贡献仅约 10% — scaling01 · 2026-09-18