4 模型跨文件修 bug 实测:3/4 通过,成本相差 10 倍,最便宜的反倒最慢翻车
lulzxdxdxd · reddit · 2026-10-08
作者继单文件测试后的跟进实验:让 4 个模型修复一个跨两个文件(序列化器 + 带 TTL 的键值存储)的 bug,并要求以 JSON 结构化输出返回完整修正源码——模拟 agent 真实编辑多文件的场景。
结果:3/4 通过全部 5 个隐藏测试
| 模型 | 价格(入/出 $/M) | 测试 | 平均耗时 | 单次成本 |
|---|---|---|---|---|
| claude-haiku-5.5 | 0.10/0.50 | 5/5 | 18s | $0.00210 |
| gpt-5.6-luna | 0.20/1.20 | 5/5 | 43s | $0.00405 |
| claude-sonnet-5.5 | 2.00/10.00 | 5/5 | 10s | $0.01853 |
| gemini-3.5-flash-lite | 0.30/2.50 | 4/5 | 2s | $0.00181 |
- 唯一失败的是最便宜的 gemini-3.5-flash-lite,败在跨模块部分:序列化器需转义自身格式的分隔符,这正是双文件拆分要考的点。
- 同样的交付物成本相差 10 倍($0.00181 到 $0.01853),差异主要由价目表决定——便宜模型写的 token 数并不少。
- 作者明确列出不可下的结论:每模型仅一次试验、任务仍太小(真实多文件工作需 5-10 个文件上下文和有错漏的 spec)、通过隐藏测试不等于好的 diff。
- 实际改变:按步骤选模型——「给文件和失败测试,让它通过」用便宜的,「判断该改哪些文件」才用贵的,钱省在这个拆分上。
「编程与Agent」频道最新
- Vibe coding 十大法律陷阱:上线上线前可能先吃官司 — alex_verem · 2026-10-08
- 微软扩展 GitHub Spec Kit:企业级规格驱动开发的分层方案 — WirelessLife · 2026-10-08
- AI Agent 越权泄漏薪酬数据,社区总结上线前五项权限自查法 — Wild-Lawyer8511 · 2026-10-08
- Codex 排障后续:真实复现故障并自行找到 MCP 日志位置 — dfinke · 2026-10-08
- Codex 自主配置 MCP:写 mcp.、起 server、跑基线全包 — dfinke · 2026-10-08
- 手动配 MCP 太折磨,作者干脆全程让 Codex 代劳 — dfinke · 2026-10-08