5 个月 4000 次运行复盘:开源 deep research harness 可靠性经验

Public_Umpire_1099 · reddit · 2026-09-16

作者用了近 5 个月打造一个开源的 deep research + builder + agent 应用,自评为目前最接近 Manus 和 Perplexity 的开源方案,基准上与 Gemini/Claude/ChatGPT 的 deep research 报告持平,建站能力对标 Bolt、Lovable、Replit。目标基准是 agent 连续 300 次随机建站零失败,失败一次计数归零。

核心可靠性经验:

作者还将放出约 4000 次构建运行的原始数据和 deep research 运行记录,首批数据已开源于 GitHub(disco-wave-history)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →