同一模型不同评测框架成绩悬殊,开发者呼吁标准化 harness 评测

zainhas · x · 2026-09-10

有开发者指出,同一新模型在不同 harness(评测/调用框架)下表现差异巨大,以至于你根本无法判断自己在用前沿模型还是一年前的水平;呼吁行业常态化发布「跨 harness 的模型性能」数据,让评测口径透明化。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →