DeepSeek V4-Flash跑分逼近GPT-4o,社区批基准测试已严重过拟合

rickasaurus · x · 2026-08-03

作者指出当前大模型基准测试存在严重的过拟合问题,并嘲讽相关跑分图表已失去参考价值。他引用数据称,5个月前GPT-4o在Artificial Analysis智能指数上的最高分为51,而本周DeepSeek V4-Flash在同一榜单拿下了50分。

此外,Reddit的r/LocalLLaMA社区已有用户成功在Mac M2 Ultra上本地运行DeepSeek V4-Flash。作者据此预测,本地运行模型将在未来两年内成为主流选择。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →