实测 12 个大模型修 Bug:最便宜的模型反而最烧钱

deusaquilus · reddit · 2026-08-05

一位开发者让 12 个 AI 模型修复同一个缓慢的 Postgres 查询,并为每个模型提供了可测试验证的 MCP 服务器,每次工具调用收费 0.20 美元。

测试发现,昂贵的模型通常只需几次调用就能快速找到正确答案;而便宜的模型则反复用无效代码进行测试。如果只看 Token 价格,最便宜的模型仅为最贵模型的 1/135。但一旦将工具调用成本计入,所有模型的实际花费相差无几(1.82 美元至 3.51 美元之间)。作者指出,Kimi K3 在此次测试中表现独特,兼具低成本与高智能。结论是:评估模型成本不能只看 Token,更要计算工具调用的次数。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →