benchmark "饱和"真相:老基准沦为合成环境饲料而非直接污染

teortaxesTex · x · 2026-09-13

作者对自己此前转发的 DeepSeek V4.1 Flash 污染指控补充更冷静的分析:他同意质疑,但认为"更无聊的现实"不是直接的 benchmark 污染——老 benchmark 会变成合成训练环境的原料,而成熟实验室的评测与环境复杂度早已超过公开 benchmark。作者还在另一条中提到 GLM 5.3 Flash 在 TB 4.0 上碾压 Muse Spark,但因没用过 Spark 而对孰优持不可知态度。

所属事件:DeepSeek V4.1 Flash被指benchmark污染引争议(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →