自建 harness×模型基准:Claude Code 满分且 fastest 进前十

dh7net · reddit · 2026-09-28

Reddit 用户为解决「真实场景下 harness 和模型组合难以比较」的问题,自制了一套覆盖基础数学、视觉、计算机操作(读邮件、逛商店页面)和编码的基准,同时测能力和速度。

按能力排名前十(节选)

按速度排名亮点

核心结论:同一模型在不同 harness 下能力差距可达数十分,本地 5090 跑小模型虽免费但耗时数倍,harness 的选择对实际体验影响巨大。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →