DeepSeek V4 新版被指挤牙膏:多基准测试表现与旧版无异
teortaxesTex · x · 2026-08-13
有开发者对 DeepSeek 最新放出的 V4-0813 版本模型进行横向评测后指出,其在绝大多数基准测试中的表现与 7 月底发布的 V4-Flash-0731 几乎完全一致,甚至在 SciCode 代码评测上的成绩还有所倒退。
被引用的讨论者推测,该模型目前仍处于训练不足的状态,能力表现比较“参差不齐”。尽管部分综合榜单显示其分数有所上涨,但整体来看缺乏显著突破。
所属事件:DeepSeek V4新版被指挤牙膏:与旧版高度同质(2 条相关)→
「模型」频道最新
- Grok 4.6缓存价格暗中上调,比肩GPT-5.6 — oran_ge · 2026-08-13
- 纯 Rust 浏览器端运行:Qwen3-TTS 本地语音克隆实测 — doodlestein · 2026-08-13
- AT&T 日均消耗 450 亿 Token,转向开源模型省近九成成本 — SuB8u · 2026-08-13
- Grok 4.6 与 Qwen3.8-Max 齐发,播客探讨 AI 前缘开源与闭源之争 — thursdai_pod · 2026-08-13
- OpenAI 下一代模型 Astra 猜想:主打智能云系统 — haider1 · 2026-08-13
- Grok-4.6 实测:Agentic Coding 基准分数提升近 5% — karminski3 · 2026-08-13