博主吐槽基准图表"造假":DeepSeek V4.1 得分竟低于 DeepSWE

teortaxesTex · x · 2026-09-11

teortaxesTex 嘲讽某博客的 TerminalBench 4.0 图表 "chart crime":图中显示的 TerminalBench 4.0 与 DeepSWE 分数竟然比 DeepSeek V4.1 还低。引用帖指出原博客截图有裁剪问题,并给出完整原图链接。围绕 DeepSeek 新模型基准呈现方式的争议讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →