用自己 git 历史自建编码评测集:Flash Next Q2 夺冠,Claude 仅 8/12
fintip · reddit · 2026-09-22
一位本地模型玩家不满公开 benchmark 的跑分文化,用 Claude 扫描自己十年的 git 提交历史,挖出真实 bug 作为测试题,构建了一个无法被 benchmax 的私人编码评测框架:已有 100+ 候选题、12 道精选核心题,本地模型跑一轮需 4-6 小时。
早期结果(12 题制,本地模型用 opencode,Gemini 用 agy-cli):
- Flash Next Q2 K XL 以 11/12 居首;虽然生成更慢,但 token 效率高,总耗时与 27B Q3 相当
- 新出的 Swift 27B 表现亮眼,10/11 并列第二,速度快且省 token
- 27B vanilla Q3(unsloth)也拿到 10/11
- Gemini 3.8 Flash(medium 默认档)10/12
- 此前不被看好的 Bonsai 拿到 8/10(2 题因 harness 问题待重跑)
- 印证了近期「Claude 被削弱」的讨论:Claude Code(open 5 + fable advisor)仅 8/12,Haiku medium + fable 也 8/12,Haiku low 无 fable 6/12
作者自评测试集可能偏重 Claude 的弱项(近期项目多用 Claude Code 写),完整结果待续。
「模型」频道最新
- 小米 MiMo 2.6 Pro 协助完成李-约克定理 Lean 形式化,超 6000 行代码 — bookwormengr · 2026-09-22
- 首个古希腊语大模型 Apollo 诞生,专修残破莎草纸文献 — nordicinst · 2026-09-22
- Two Minute Papers 解读 Jev:宣称让 AI 提速 200 倍但有代价 — Two Minute Papers · 2026-09-22
- 针对特定任务,LLM 之外存在更便宜更有效的技术 — evilsocket · 2026-09-22
- cloneofsimo:学界严重低估 OpenAI 数学 Agent 已解决的问题量 — cloneofsimo · 2026-09-22
- KDDI 创始人实测:让 AI 自评新旧输出质量,性能自动回稳 — i_dg23 · 2026-09-22