DeepSeek与Maka评测成绩对比:基数不同致结果失真
teortaxesTex · x · 2026-08-02
针对近期流传的 DeepSeek 与 Maka 模型评测分数对比,有开发者指出两者存在统计口径差异。DeepSeek 在 Terminal Bench 2.1(官方测试框架)的得分为 82.7%;而 Maka 报告的 85.3% 通过率,仅是基于未超时跑完的 61 道题目的子集计算得出。由于分母和测试基数不同,这并非严格的同口径对比,直接比较分数容易产生误导。
「模型」频道最新
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24
- 隐身模型 Ox Alpha 登场 Context Arena,匹配 GPT-5.6 — scaling01 · 2026-08-24
- Fable 5 仅占 6% 销量,Anthropic 遭遇降本冲击 — rohanpaul_ai · 2026-08-24
- Opus 5 说话像法庭剧?如何调教掉废话 — thk_ · 2026-08-24
- 2026 年中国模型全景:DeepSeek V4、Kimi K3 等在列 — TheTuringPost · 2026-08-24
- 传闻 Claude Opus 6 泄露:上下文 250 万,推理更强 — iamaliveix · 2026-08-24