本地跑超10亿Token实测:开发者质疑DS新模型刷榜

Sentdex · x · 2026-08-06

开发者 @Sentdex 分享了其在本地运行 DSV4F-Preview 处理超过 10亿 Token 的实测感受。他表示非常喜欢该模型,但认为 0731 版本的表现实际上不如前代。

他质疑 0731 模型报告的基准测试成绩存在严重的“刷榜”嫌疑,并呼吁社区探讨:是否有人真正觉得 0731 相当或优于 GLM 5.2? 是否有独立测试框架能验证其跑分优势?

所属事件:开发者实测超10亿Token质疑DeepSeek新版刷榜(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →