5 个月 4000 次运行复盘:开源 deep research harness 可靠性经验
Public_Umpire_1099 · reddit · 2026-09-16
作者用了近 5 个月打造一个开源的 deep research + builder + agent 应用,自评为目前最接近 Manus 和 Perplexity 的开源方案,基准上与 Gemini/Claude/ChatGPT 的 deep research 报告持平,建站能力对标 Bolt、Lovable、Replit。目标基准是 agent 连续 300 次随机建站零失败,失败一次计数归零。
核心可靠性经验:
- 一次过夜运行中,Qwen3.6 27B 自托管建站完美,但之后陷入无限读文件、无法编辑的死循环。根因不是模型不行,而是 harness 的 edit 工具要求逐字符精确匹配、文件读取会静默截断长内容、循环把「读取」也算作进展。
- 修复方案:把 edit 工具改为宽容匹配、增加按行定位的操作、对读取分页、在读文件连续无修改时触发 nudge 提醒——修复后同一模型表现恢复正常。
- 作者批评当前开源社区充斥低质 harness(6000+ 行单文件、几乎无测试、满屏 emoji 的 slopware),强调自己做了充分测试而非周末速成品。
作者还将放出约 4000 次构建运行的原始数据和 deep research 运行记录,首批数据已开源于 GitHub(disco-wave-history)。
「编程与Agent」频道最新
- mitsuhiko 点破 codemode 失效根因:工具输出不稳定、非结构化 — mitsuhiko · 2026-09-16
- Muse Code 上调贡献者订阅额度,并全员重置用量 — giffmana · 2026-09-16
- OpenAI 内部万级 Agent 编排系统曝光,用户版 3 个子代理反被批浪费 token — RexDouglass · 2026-09-16
- 开发者用 GPT-6 重写 Radish:在 Durable Object 里跑 Redis — whoiskatrin · 2026-09-16
- Agent 回答看似全对实则有 Bug,何时才敢放手不复查? — Luvena21 · 2026-09-16
- RSIAgent 不改权重自我进化,两项 agent 基准超 GPT-6 Astra — Roger_M_Taylor · 2026-09-16