自建 harness×模型基准:Claude Code 满分且 fastest 进前十
dh7net · reddit · 2026-09-28
Reddit 用户为解决「真实场景下 harness 和模型组合难以比较」的问题,自制了一套覆盖基础数学、视觉、计算机操作(读邮件、逛商店页面)和编码的基准,同时测能力和速度。
按能力排名前十(节选)
- Claude Code:100%(14m26s)
- openclaw/openrouter/qwen3.8-max-0902:98%(26m33s)
- opencode/openrouter/deepseek-v4.1-flash:96%(10m56s)
- hermes/rtx5090/qwen3.8-27b-nvfp4:96% 但耗时 1h50m
- Codex Sol 5.6 Medium:96%(21m54s)
按速度排名亮点
- openclaw/openrouter/kimi-k2.6 最快(1m33s)但得分仅 18%
- deepseek-v4.1-flash 在 opencode 下 10m56s 拿到 96%,速度与能力平衡最佳
- Claude Code 以 14m26s 成为前十中唯一满分
核心结论:同一模型在不同 harness 下能力差距可达数十分,本地 5090 跑小模型虽免费但耗时数倍,harness 的选择对实际体验影响巨大。
「编程与Agent」频道最新
- Claude Code 创造者 Boris Cherny:赌通用模型,别微调别小模型 — rohanpaul_ai · 2026-09-28
- 个人 Agent 不缺额度缺固定活儿:先写清边界再敢放手跑 — sujingshen · 2026-09-28
- 个人 agent 时代 app 两条出路:接入 MCP 还是自变成 agent? — sujingshen · 2026-09-28
- 30 个 Claude Opus 5.5 浏览器动画爆款案例,按观看量排序附提示词 — dotey · 2026-09-28
- 一家共用一个 agent,谁的「不准」该算数? — sujingshen · 2026-09-28
- Rolldown 将推实验特性 inlineCommonChunks,减少小型共享 chunk — cnakazawa · 2026-09-28