DeepSeek V4 Flash 0731 评测:智能指数达 50,逼近 GPT-5.6
ArtificialAnlys · x · 2026-07-31
Artificial Analysis 发布了 DeepSeek V4 Flash 0731 的最新评测报告。该模型智能指数达到 50 分,较前代跃升 10 分,反超自家 V4 Pro 6 分,且在智能与成本的帕累托前沿上表现优异。
核心数据与亮点:
- 极具性价比:得益于 98% 的缓存命中率折扣,其任务成本比同智力的 GPT-5.6 Luna 低约 60%。
- 智能体能力大幅提升:在 GDPval-AA v2 上的 Elo 得分从 1189 暴涨至 1559,Terminal-Bench 等测试也显著提升。
- Token 效率优化:运行智能指数测试的输出 Token 较前代下降 12%。
- 幻觉减少:AA-Omniscience 幻觉率下降 12% 至 84%,推动了整体表现改善,而参数规模保持 284B 不变。
模型上下文窗口为 100 万 Token,预计将在未来几周内开放完整权重。
所属事件:DeepSeek V4-Flash 跑分曝光反超 Pro 版,极致性价比引热议(19 条相关)→
「模型」频道最新
- 同价位大模型实测:DeepSeek V4-Flash 多模态胜过 GPT-5.6 Luna — teortaxesTex · 2026-07-31
- DeepSeek V4-Flash 性能暴涨,或因 V4-Pro 充当 RL 教师 — teortaxesTex · 2026-07-31
- DeepSeek 推理 RL 训练受赞,规避模型废话与幻觉 — teortaxesTex · 2026-07-31
- 实测对比:o3 在 OSINT 任务中表现依然强悍 — bytebot · 2026-07-31
- 曝 Gemini 3.5 Pro 或于本周末发布 — gaganghotra_ · 2026-07-31
- Kimi RL 训练实力获赞:有效避免幻觉与废话 — teortaxesTex · 2026-07-31