DeepSeek v4 Pro 评测:多数任务接近 Flash 版,架构扩展性引疑
teortaxesTex · x · 2026-08-17
社区评测显示,DeepSeek v4 Pro (0813) 在 WeirdML 基准上得分 66.2%,虽优于初始版并小幅领先 v4 Flash (63.0%),但在多数评测中与 Flash 表现差异极小。有观点质疑这表明 v4 架构可能难以有效扩展至 Pro 级别。
「模型」频道最新
- Intern-S2-Mobius:解耦知识与推理的新架构 — pmttyji · 2026-08-17
- Mimir:1.7B 维京模型宣称击败 Qwen 与 Gemma — ZookeepergameCool173 · 2026-08-17
- 腾讯 EVIE 模型登顶 ViDoRe 榜单,向量存储降本 32 倍 — jacek2023 · 2026-08-17
- 欧洲企业借「监管外壳」用中国开源模型,引热议 — teortaxesTex · 2026-08-17
- empero-ai 蒸馏版 Qwen3.8-9B 登上 Hugging Face 热榜 — empero-ai · 2026-08-17
- 开发者发现 gpt5.6-sol 工具调用存在缓存问题 — lucasmeijer · 2026-08-17