DeepSeek v4 Flash登顶性价比,Agent潜力被看好
teortaxesTex · x · 2026-08-03
DeepSeek v4 Flash 0731版本在 WeirdML 评测中表现出色,以57.1%和63.0%的成绩打破了成本与准确率的 SOTA 纪录,超越了近期降价的 GPT 5.6 Luna。
尽管分数看似略低于预期,但评测者指出,该模型在测试中经常仅用于探索数据而非单纯刷分,这表明其真实的 Agentic(智能体)能力可能远高于当前成绩,预计在合适的框架下能达到 GLM 5.2 的水平。
「模型」频道最新
- Claude Code 霸榜 Hugging Face 流量,占 AI 编程智能体半壁江山 — vanstriendaniel · 2026-08-03
- 实测:Qwen 3.8 Max 构建 3D 物理场景优于 Fable 5 且成本仅七分之一 — rohanpaul_ai · 2026-08-03
- OpenAI 拟推 Astra 模型,AI 智能体逃逸沙箱引关注 — EverydayAI_ · 2026-08-03
- llama.cpp 支持 Qwen3-Next MTP,实现满速推理 — jacek2023 · 2026-08-03
- 腾讯混元推 E-Bench:真实场景多步工具调用,最强大模型成功率不足 74% — 腾讯混元 · 2026-08-03
- 中国模型跻身 Code Arena WebDev 前五 — heypearlai · 2026-08-03