benchmark "饱和"真相:老基准沦为合成环境饲料而非直接污染
teortaxesTex · x · 2026-09-13
作者对自己此前转发的 DeepSeek V4.1 Flash 污染指控补充更冷静的分析:他同意质疑,但认为"更无聊的现实"不是直接的 benchmark 污染——老 benchmark 会变成合成训练环境的原料,而成熟实验室的评测与环境复杂度早已超过公开 benchmark。作者还在另一条中提到 GLM 5.3 Flash 在 TB 4.0 上碾压 Muse Spark,但因没用过 Spark 而对孰优持不可知态度。
所属事件:DeepSeek V4.1 Flash被指benchmark污染引争议(2 条相关)→
「模型」频道最新
- OpenMed 宣言:强大智能不能掌握在少数人手里,开源 AI 必须赢 — MaziyarPanahi · 2026-09-13
- 数学家用 Codex 攻克 Navier–Stokes,OpenAI 88 小时后也解出,隐私引质疑 — rubenhassid · 2026-09-13
- 爆料称 X 正将 Grok Bots 接入 XChat,可像私信一样对话 — nima_owji · 2026-09-13
- Nex-N2.5 Pro 连续数百步通关宝可梦,超越单次 computer-use 演示 — alifcoder · 2026-09-13
- 博主十维实测:DeepSeek V4.1 可靠性较 V4-Pro-0813 大幅提升 — teortaxesTex · 2026-09-13
- 博主称微调开源模型成本仅前沿模型5%,大厂护城河崩塌 — ayushtweetshere · 2026-09-13