实测20余种让廉价编码模型变强的方法:强模型「良心监督」性价比最高
KangarooAnxious9394 · reddit · 2026-10-06
作者在真实仓库提交上做了预注册实验(协议先提交 git 再运行),以 Haiku 为廉价 agent、Sonnet 为强模型,系统测试了 20 多种让便宜模型表现接近贵模型的方法。
有效的做法:
- 让强模型只在 agent 重复犯错时才开口:63 次中多解决 7 个,成本仅增 1.3 倍(常开顾问多解决 8 个但成本 3.5 倍)。
- 运行 agent 的改动并报告事实(如「这行改成 pass 后所有测试仍通过」)胜过直接建议:35/42 vs 32/42,格式回归从 10 降到 0。
- 用自己的话记录偏好并带入后续任务:合规率从 40% 提升到 90%(15/15 vs 0/15)。
无效的做法:代码知识记忆、通用检查清单、从 git 历史学规则、模型路由、澄清式提问;对强模型(Sonnet)这些全都没提升(45/45 持平)。
每解决一个任务的最便宜组合是 Haiku + 「conscience」约 $1.22,Sonnet 单独约 $1.41。论文、协议、失败记录与工具全部公开(源码可用、非商业许可,兼容 Claude Code、Codex 和 OMP)。
「编程与Agent」频道最新
- Matt Shumer 在 Spawn 上直播与 AI 共建霍格沃茨多人游戏 — mattshumer_ · 2026-10-06
- Ruff 作者分享构建提速技巧:每个文件独立 crate 化 — charliermarsh · 2026-10-06
- 著名反 MCP 人士倒戈:呼吁官方维护 Gmail MCP — zeeg · 2026-10-06
- 软件在环自监督:从现有科学软件批量生成终端 agent 训练环境 — Zhongzhi Li · 2026-10-06
- 实拍产品图配 LTX-2.5 生成旋转动效,再用 Codex 写完品牌官网 — OpenAIDevs · 2026-10-06
- OpenHands 项目 GitHub 星数突破 90K,感谢开源社区共建 — rajistics · 2026-10-06