模型找 bug 能力越强成本指数级上涨,Paweł Huryn 实测揭示性价比曲线
garrytan · x · 2026-09-24
Paweł Huryn 测试了各家模型在「找出代码中人为埋入 bug」任务上的表现,发现性能提升与调用成本呈指数关系(横轴为对数刻度),并用 ChatGPT 叠加了趋势线:位于趋势线上方的模型属于「性价比划算」。Paul Graham 转发了这一观察。这条曲线给「该用哪个模型做代码审查」提供了直观参考——不一定要追最贵的模型。
「编程与Agent」频道最新
- Salesforce 推出 JitMem:读取时才整理记忆,Agent 三大基准最高提升 16.3 分 — Salesforce · 2026-09-24
- 用编程 Agent 训练机器人:Em-bodiedSWE 让 VLA 在真实机器人上完成长时程任务 — Haoxiang You · 2026-09-24
- Discord 在菲律宾被封,开源工具 Discrawl 帮你本地备份全站记录 — steipete · 2026-09-24
- 接上 Coinbase MCP,让 AI Agent 每天替你读市场简报管持仓 — MurrLincoln · 2026-09-24
- 阿里 Qoder 限时免费用 Qwen3.8-Flash,免费账号也适用 — Aiden_Tech_Ai · 2026-09-24
- 论文:用 38.5% 题目复现生产级 Agent 评测,误差仅 1 分 — omarsar0 · 2026-09-24