同一需求三模型实测:0.5 美元的腾讯 Hy3 方案胜过 4 美元的 Claude
tejasghutukade · reddit · 2026-09-15
开发者 dogfooding 自研开源项目 Stageflow 时做了个小实验:同一条 feature 需求,用同一套工作流分别跑 Claude Sonnet 5(约 $4)、Qwen 3 Coder(约 $1.70)和腾讯 Hy3(约 $0.50),最后选择合并的却是 Hy3 的实现。
工作流并非单次提示,而是完整的多阶段流程:brainstorm → plan → implement → review → 修复 review 发现 → verify → PR,每个阶段职责明确、带检查门槛。
作者的核心观点:行业可能过度关注「哪个模型最聪明」,而模型外围的工作流设计同样关键——只要任务拆解得当、上下文有意交接、输出有验证,就不必让最贵的模型包办每一步。可以把模型当作受控工程流程里的专用工人。当然这只是单例,不是科学 benchmark。
Stageflow 是其开源的可配置多阶段 agent 工作流项目( GitHub: tejasghutukade/stageflow )。
「编程与Agent」频道最新
- 吴恩达称 prompting 六个月内将被 loops 与 graphs 取代 — Roger_M_Taylor · 2026-09-15
- Stripe 工程师实测:开发工具该为「不看文档的 Agent」重做 — hazelcough · 2026-09-15
- 实测 7 个模型建 T 恤店:模型宁凭权重写旧代码,也不查最新文档 — hazelcough · 2026-09-15
- 同一实测:21 次运行没有一个模型设计出我愿意穿的 T 恤 — hazelcough · 2026-09-15
- Stripe 工程师:T 恤店是电商的最小可测单元 — hazelcough · 2026-09-15
- 7 个模型建 T 恤店:21 次运行仅 7 次可用,失败多为静默 bug — hazelcough · 2026-09-15