4 模型跨文件修 bug 实测:3/4 通过,成本相差 10 倍,最便宜的反倒最慢翻车

lulzxdxdxd · reddit · 2026-10-08

作者继单文件测试后的跟进实验:让 4 个模型修复一个跨两个文件(序列化器 + 带 TTL 的键值存储)的 bug,并要求以 JSON 结构化输出返回完整修正源码——模拟 agent 真实编辑多文件的场景。

结果:3/4 通过全部 5 个隐藏测试

| 模型 | 价格(入/出 $/M) | 测试 | 平均耗时 | 单次成本 |

|---|---|---|---|---|

| claude-haiku-5.5 | 0.10/0.50 | 5/5 | 18s | $0.00210 |

| gpt-5.6-luna | 0.20/1.20 | 5/5 | 43s | $0.00405 |

| claude-sonnet-5.5 | 2.00/10.00 | 5/5 | 10s | $0.01853 |

| gemini-3.5-flash-lite | 0.30/2.50 | 4/5 | 2s | $0.00181 |

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →