同一需求三模型实测:0.5 美元的腾讯 Hy3 方案胜过 4 美元的 Claude

tejasghutukade · reddit · 2026-09-15

开发者 dogfooding 自研开源项目 Stageflow 时做了个小实验:同一条 feature 需求,用同一套工作流分别跑 Claude Sonnet 5(约 $4)、Qwen 3 Coder(约 $1.70)和腾讯 Hy3(约 $0.50),最后选择合并的却是 Hy3 的实现。

工作流并非单次提示,而是完整的多阶段流程:brainstorm → plan → implement → review → 修复 review 发现 → verify → PR,每个阶段职责明确、带检查门槛。

作者的核心观点:行业可能过度关注「哪个模型最聪明」,而模型外围的工作流设计同样关键——只要任务拆解得当、上下文有意交接、输出有验证,就不必让最贵的模型包办每一步。可以把模型当作受控工程流程里的专用工人。当然这只是单例,不是科学 benchmark。

Stageflow 是其开源的可配置多阶段 agent 工作流项目( GitHub: tejasghutukade/stageflow )。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →