用 15 种 harness 跑同一任务结果一致,引出「评测基准怎么选」之争
paul_cal · x · 2026-09-18
- xeophon 称用 15 种 harness 以最大设置运行 Fable 5.1 生成 Hello World,结果全部相同,因此认为 harness 本身不重要。
- paulcal 追问其所用的 grader(评分器)是什么;xeophon 回答没细看,也没实际检查输出。
- 争论焦点:不检查输出就断言「harness 无关紧要」,评测方法本身是否可靠。
所属事件:15 种 harness 跑同一任务结果相同引评测之争(2 条相关)→
「编程与Agent」频道最新
- OutlierKit 开放 YouTube 研究 API 与 10 工具 MCP 服务器 — ayushtweetshere · 2026-09-18
- Cloudflare 自曝在造新一代 CI/CD:用 TypeScript 编写管道,公开征集需求 — dinasaur_404 · 2026-09-18
- ProgramAsWeights 把自然语言描述编译成本地运行的微型神经程序 — yuntiandeng · 2026-09-18
- MonidHQ 推出免费 agent 搜索方案,叫板 Exa、Tavily 的按次收费 — gnukeith · 2026-09-18
- Jev 模型专攻低中熵任务,开发者称前端模型只留给高熵活 — multiply_matrix · 2026-09-18
- Bend 2 中实现 SHA-256 并给出机器可验的正确性证明 — banteg · 2026-09-18