DeepSeek与Maka评测成绩对比:基数不同致结果失真

teortaxesTex · x · 2026-08-02

针对近期流传的 DeepSeek 与 Maka 模型评测分数对比,有开发者指出两者存在统计口径差异。DeepSeek 在 Terminal Bench 2.1(官方测试框架)的得分为 82.7%;而 Maka 报告的 85.3% 通过率,仅是基于未超时跑完的 61 道题目的子集计算得出。由于分母和测试基数不同,这并非严格的同口径对比,直接比较分数容易产生误导。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →