实测 12 个大模型修 Bug:最便宜的模型反而最烧钱
deusaquilus · reddit · 2026-08-05
一位开发者让 12 个 AI 模型修复同一个缓慢的 Postgres 查询,并为每个模型提供了可测试验证的 MCP 服务器,每次工具调用收费 0.20 美元。
测试发现,昂贵的模型通常只需几次调用就能快速找到正确答案;而便宜的模型则反复用无效代码进行测试。如果只看 Token 价格,最便宜的模型仅为最贵模型的 1/135。但一旦将工具调用成本计入,所有模型的实际花费相差无几(1.82 美元至 3.51 美元之间)。作者指出,Kimi K3 在此次测试中表现独特,兼具低成本与高智能。结论是:评估模型成本不能只看 Token,更要计算工具调用的次数。
「编程与Agent」频道最新
- “验证分片”:利用海量智能体分布式验证输出 — curious_vii · 2026-08-05
- 若身处ASI前夕,软件创业的六大核心机会 — pzakin · 2026-08-05
- 在 K8s 上安全运行 AI 智能体:零信任架构与沙箱隔离实践 — WirelessLife · 2026-08-05
- Claude 智能体操盘 5 万美元跑赢标普,吸引 2700 万美元跟单 — emeka_boris · 2026-08-05
- 8美元打造桌面机器人:开源框架Xiaozhi让ESP32实现本地语音交互 — TinfoilTricorn · 2026-08-05
- AI Agent 接管电脑,通用 CPU 算力恐成新瓶颈 — peterjliu · 2026-08-05