SelfBench 用真实 GitHub PR 测编码模型:开源模型更贵还更弱
ycombinator · x · 2026-10-06
SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,用于测出在你的代码库上最划算的编码模型/agent。作者用它在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是:开源权重模型在真实工作上通常更贵且能力更弱。
主要结果(最准确/最省钱配置):
- Next.js:GPT-6.1 Sol 最准,84.2%,每任务 $0.91;省钱档也是 GPT-6.1 Sol(78.9%,$0.56)
- Sentry:Claude Sonnet 5.5 最准 82.9%($0.59/任务)
- PostHog:Claude Opus 5.5 最准 69.4%,但每任务 $2.23;省钱选 GPT-6.1 Sol
- vercel:Claude Opus 5.5 最准 80.9%;省钱档 Kimi K3 达 78.7%($0.96)
- Supabase:GPT-6.1 Sol 全面领先(77.8%,每任务低至 $0.24)
工具与仓库已开源,可对自己的仓库跑同样的评测。
「编程与Agent」频道最新
- Gradio 推出 ml-intern 提示词,一句话即可训练你自己的模型 — Gradio · 2026-10-06
- 性能优化多数胜利只需改不到 5 行代码 — DanielLockyer · 2026-10-06
- 开发者困惑:全用 Claude Code 干活后反而感觉脱节 — zsakib_ · 2026-10-06
- 从 agent 经验自动沉淀结构化 wiki,再据此构建未来技能 — rseroter · 2026-10-06
- 用 EvoX 整理 bug 报告:AI 会让「没拍到」悄悄变成「用户跳过」 — yawning42 · 2026-10-06
- Rust 分块库 Chunkr 号称比 LangChain 快 20 倍,开源并附完整跑分 — Ok_Cartographer5609 · 2026-10-06