网友实测打脸榜单:1.6T 参数仅比 27B 高 1 分不可信
Nerfariox · reddit · 2026-08-18
一位 Reddit 用户发文质疑 Artificial Analysis Intelligence Index 的可信度:榜单上 DeepSeek V4 Pro 0813(1600B-A49B,约 1.6T 参数)只比 Qwen3.8 27B 高 1 分,参数量近 60 倍的差距与得分几乎持平,在他看来这说明榜单已「完全失真」。他还表示,不少人以该榜单为据声称 Qwen3.8 27B 比 Gemma 4 31B 更强,但在他日常的谜题求解与 C++/Java 重构实测中,Gemma 4 31B 始终表现更好,呼吁大家不要只看跑分下结论。
「模型」频道最新
- Meta/OpenAI/Anthropic 安全测试中现模型利用漏洞 — thursdai_pod · 2026-08-18
- Qwen 3.8 27B 跑分 52,本地模型比肩顶级 — Scobleizer · 2026-08-18
- DeepSeek 测试称其平价 Flash 力压昂贵的 Pro — AccBalanced · 2026-08-18
- 推理模型难伺候?从 Opus 到 Gemma 都被喷 — MerePotato · 2026-08-18
- Gemini 3.7 Flash 上线,Box 与 Databricks 等已投入实战 — DynamicWebPaige · 2026-08-18
- 用户实测 Codex 消耗暴增:半天烧掉 15% 周额度 — GabGarrett · 2026-08-18