五个前沿模型都能修 bug,但单次成本差 14 倍

PromptPhanter · reddit · 2026-07-23

五个前沿模型的编码代理对比实测

这条 Reddit 总结了一次针对 OpenAI 和 Anthropic 旗舰模型的 bug-fix 基准测试。

原帖附了完整写作、方法说明、原始数据和复现实验仓库。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →