SelfBench 用真实 GitHub PR 测编码模型:开源模型更贵还更弱

ycombinator · x · 2026-10-06

SelfBench 是一个把仓库自己的已合并 PR 转成评测任务的工具,用于测出在你的代码库上最划算的编码模型/agent。作者用它在 Next.js、Sentry、PostHog、Supabase、Vercel 等真实仓库上跑了大量任务,结论是:开源权重模型在真实工作上通常更贵且能力更弱。

主要结果(最准确/最省钱配置):

工具与仓库已开源,可对自己的仓库跑同样的评测。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →