网友实测打脸榜单:1.6T 参数仅比 27B 高 1 分不可信

Nerfariox · reddit · 2026-08-18

一位 Reddit 用户发文质疑 Artificial Analysis Intelligence Index 的可信度:榜单上 DeepSeek V4 Pro 0813(1600B-A49B,约 1.6T 参数)只比 Qwen3.8 27B 高 1 分,参数量近 60 倍的差距与得分几乎持平,在他看来这说明榜单已「完全失真」。他还表示,不少人以该榜单为据声称 Qwen3.8 27B 比 Gemma 4 31B 更强,但在他日常的谜题求解与 C++/Java 重构实测中,Gemma 4 31B 始终表现更好,呼吁大家不要只看跑分下结论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →