用户质疑 Artificial Analysis 基准评测存在美国中心主义偏见
Eden63 · reddit · 2026-08-16
Reddit 用户注意到 Artificial Analysis 仍未收录 Qwen 32B 等多个知名本地模型的基准成绩,而 Muse Glimmer 却很快上线。作者质疑该平台过于关注“前沿”模型,且模型覆盖存在美国中心主义偏见,导致其公正性存疑。同时,替代方案如 LLM-Stats.com 的可信度也不足。作者寻求更中立、透明、可靠的基准测试或模型追踪网站。
「模型」频道最新
- MoE 架构 Qwen 模型本地评测表现优异 — StefanoGogioso · 2026-08-16
- 国产大模型进入后训练时代,DeepSeek与智谱争鸣 — teortaxesTex · 2026-08-16
- Opus 5 表现引质疑,被指“开源版GPT”,模型似训练失控 — arthurcolle · 2026-08-16
- 阿里 Qwen3.8-27B 登顶 Hugging Face 热榜第一 — cephaloform · 2026-08-16
- Anthropic神秘Model 2曝光,或为Claude Mythos 6;Gemini 3.7 Flash、DeepSeek V4 Pro等重磅发布 — WorldofAI · 2026-08-16
- 量化模型质量存疑?实测显示 Q4 精度达 92-95% — gajesh · 2026-08-16