网友指 DeepSeek V4.1 Flash 疑似被公开 benchmark 污染
teortaxesTex · x · 2026-09-13
有用户指控 DeepSeek V4.1 Flash 存在公开 benchmark 污染,依据是其模型卡中的数据表现;Kimi K3 也可能存在同样问题。原推还提出一个观察:被污染的模型在训练时未见过的新 benchmark 上排名会不成比例地下滑。同时承认无论是否有意,这仍是出色的模型,价值更多在架构创新而非更高的输出质量。相关指控尚未证实。
所属事件:DeepSeek V4.1 Flash被指benchmark污染引争议(2 条相关)→
「模型」频道最新
- 爆料称 GPT-6 Astra 距 GPT-5.6 Sol 发布仅八周,或成最快迭代绝唱 — kimmonismus · 2026-09-13
- 标注 8 万余条数据微调 Qwen 3.8,写作品质盲测提升 86% — Scobleizer · 2026-09-13
- 实测 Muse Spark 1.3 与 Fable 5.1 并列第一,Meta 杀入前沿 — PawelHuryn · 2026-09-13
- 公开报告显示前沿模型内部与公开版滞后约1-3个月 — xeophon · 2026-09-13
- Overnight 基准测试 45% rollout 中途失败,开发者吐槽 OpenAI 容量吃紧 — dejavucoder · 2026-09-13
- 用 Gemini 翻译 swarm 语言与英文互译,效果出奇地好 — xeophon · 2026-09-13