同一模型不同评测框架成绩悬殊,开发者呼吁标准化 harness 评测
zainhas · x · 2026-09-10
有开发者指出,同一新模型在不同 harness(评测/调用框架)下表现差异巨大,以至于你根本无法判断自己在用前沿模型还是一年前的水平;呼吁行业常态化发布「跨 harness 的模型性能」数据,让评测口径透明化。
「模型」频道最新
- 初步评估:智谱 V4.1 与 V4 环境相同、表现相近,后训练更精细 — xeophon · 2026-09-10
- Astra 对 DeepSeek V4 的技术预测与实际进展对照 — teortaxesTex · 2026-09-10
- 曝 DeepSeek V4.1 Flash 552B 参数发布,苹果折叠 iPhone 定价 1999 美元 — testingcatalog · 2026-09-10
- CoT 相似度检测显示 Qwen3.8 疑似用 GPT 5.5 思维链训练 — Chromix_ · 2026-09-10
- DeepSeek 新架构被指完全无视线性注意力,网友调侃引热议 — teortaxesTex · 2026-09-10
- 实测 GLM 5.3 Flash:写代码和查资料强,炒股和想点子差 — ManagementNo5153 · 2026-09-10