同一句话让 4 款编码工具实现,耗时从 4 分钟到 2 小时不等
SSShken · reddit · 2026-09-20
作者搭好一个 TypeScript + Express + SQLite + React 的真实项目,把同一代码库复制四份,用同一句需求(拖拽任务到另一列)测试四款 spec-driven 工具。
- 四个工具全部正确实现,零手动修复;都先读代码再规划,没碰已支持该功能的服务端 PATCH 路由,也没发明新端点
- 差异在流程:任务列表分别写 13、24、29 条(一个不写);耗时 4m26s、9m40s、36m5s、2h11m
- 加依赖:一个加 3 个且先询问,另一个加 7 个没问;两个把测试数据留在数据库;一个擅自直接提交到 main;一个点了 84 次 Allow
- 所有数据人工统计,不依赖 AI 摘要
作者指出还缺一组关键对照:同样需求用无工作流的 Claude Code 裸跑,才能判断这层 spec 工作流是否真有价值,这是下一次实验。
所属事件:同一需求实测四款 spec 驱动编码工具:耗时差达 30 倍(2 条相关)→
「编程与Agent」频道最新
- Reddit 热议:AI Agent 运行时能不能搬到 Cloudflare Workers 等 Edge? — merlinofthewater · 2026-09-20
- Jev 提出即时压缩:按工具调用评分删减 Agent 上下文,弃用总结提示词 — FinanceYF5 · 2026-09-20
- 别让 LLM 做客服分流:Jev 把非结构化输入变成可执行的智能 if — sven_ai · 2026-09-20
- Jeff Dean 27 年功力浓缩一小时:从 LLM 基础讲到 Agent 编排 Graphs — irinarish · 2026-09-20
- 多智能体系统要点:明确分工比堆数量更重要 — _jaydeepkarale · 2026-09-20
- Jev 创始人演讲:现有模型受困 RLHF,真自动化时代将到来 — hardimanjames · 2026-09-20