开源 RoastMyHarness: 用 DeepSWE 跑分检验你的 Pi 自定义工具
AnotherObsceneBean · reddit · 2026-09-13
Reddit 用户开源了 RoastMyHarness(https://github.com/sij0sh/roastmyharness),一个用于评测自定义 Pi agent 配置的小工具:它搭建环境跑 DeepSWE benchmark 任务,以裸 Pi 为基线,对比你的 harness、扩展、skill 或 AGENTS.md 改动,输出哪些提升了、哪些坏了、token 成本如何。作者还写了一个向导式 Pi 扩展来帮你配置。他提醒:想赢过裸 Pi 的任务质量/token 效率比想象中难。作者自述是数据分析出身的 vibe coder,目前仅测试于 Linux,项目仍是 WIP。对做 agent 工具/harness 的人是现成的 eval 基础设施。
「编程与Agent」频道最新
- 一小时 16 次调用:元认知反馈循环 agent 的自纠与刹车 — Dzikula · 2026-09-13
- 斯坦福秋季新开 CS329Z:从零工程化 AI Agent 课程 — jyangballin · 2026-09-13
- Draw Things 推出 Local Code 公测:Mac 本地跑编程 agent,prefill 快 1.2-1.6 倍 — liuliu · 2026-09-13
- Agent 每周变强却总解错问题:AI 接管世界还有多久? — BarriosA2I · 2026-09-13
- AI 助手只会「止住报错」,不会追问「系统为何产生这个状态」 — ClickOk5811 · 2026-09-13
- Swarms 重构聊天界面,接 2000+ 模型的 Agent 市场 — KyeGomezB · 2026-09-13