DeepSeek V4-Flash跑分逼近GPT-4o,社区批基准测试已严重过拟合
rickasaurus · x · 2026-08-03
作者指出当前大模型基准测试存在严重的过拟合问题,并嘲讽相关跑分图表已失去参考价值。他引用数据称,5个月前GPT-4o在Artificial Analysis智能指数上的最高分为51,而本周DeepSeek V4-Flash在同一榜单拿下了50分。
此外,Reddit的r/LocalLLaMA社区已有用户成功在Mac M2 Ultra上本地运行DeepSeek V4-Flash。作者据此预测,本地运行模型将在未来两年内成为主流选择。
「模型」频道最新
- Kimi K3 Max 智能体实测:单美元解决任务数达 2.8 倍 — togethercompute · 2026-08-03
- OpenAI新模型攻克10项数学难题,奥特曼呼吁放慢研发节奏 — APPSO · 2026-08-03
- DeepSeek 实测:与非技术人员协作完成复杂财务建模 — kmouratidis · 2026-08-03
- 需求转向低价模型,LLM 推理 Token 价格指数持续下滑 — AccBalanced · 2026-08-03
- 网友热议期待:MiniMax H3 模型即将发布 — Fresh_Sun_1017 · 2026-08-03
- 曝 DeepSeek V4 模型思考模式调整:Flash 引入四级推理强度 — teortaxesTex · 2026-08-03