同一模型同一榜单分数大不同,DeepSeek 模型卡揭示评测失真
solyarisoftware · x · 2026-09-12
DeepSeek V4.1 模型卡中一张表格引发关注:同一模型、同一 benchmark,在不同 agent harness 下得分差异巨大。
发帖人借此指出行业通病:新模型发布时拿自己的分数与以往公开数字直接对比,若 harness 和配置没有对齐,这种对比几乎毫无意义。这再次印证了 benchmark 分数高度依赖评测脚手架,跨模型榜单排名的参考价值被普遍高估。
「模型」频道最新
- Codex 质量问题已修复,补偿性重置额度正全量推送 — CtrlAltDwayne · 2026-09-12
- Codex 用量重置机制曝光:9 月 12 日 07:00 UTC 上线,尚未确认执行 — DevDminGod · 2026-09-12
- Qwen3.8-27B 上线 Cerebras,AAII 得分 34 比肩 GPT-5.6 Luna — Alibaba_Qwen · 2026-09-12
- antirez 上传 DeepSeek V4.1 Flash GGUF 量化版到 Hugging Face — Queasy_Asparagus69 · 2026-09-12
- Qwen3.8-Max 在 OpenRouter 得分骤降,作者怀疑 effort 参数未被正确传递 — PawelHuryn · 2026-09-12
- Pipecat v1.9 发布:接入 Meta 流式语音转写模型 Muse,语义错词率最低 — solyarisoftware · 2026-09-12