用自己 git 历史自建编码评测集:Flash Next Q2 夺冠,Claude 仅 8/12

fintip · reddit · 2026-09-22

一位本地模型玩家不满公开 benchmark 的跑分文化,用 Claude 扫描自己十年的 git 提交历史,挖出真实 bug 作为测试题,构建了一个无法被 benchmax 的私人编码评测框架:已有 100+ 候选题、12 道精选核心题,本地模型跑一轮需 4-6 小时。

早期结果(12 题制,本地模型用 opencode,Gemini 用 agy-cli):

作者自评测试集可能偏重 Claude 的弱项(近期项目多用 Claude Code 写),完整结果待续。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →