Qwen 27B 在 Artificial Analysis 跑分遭质疑
chocolateUI · reddit · 2026-08-22
Reddit 用户质疑 Artificial Analysis (AA) 的“智能指数”基准缺乏实际意义。根据 AA 数据,Qwen 3.8 27B 的得分竟然超过了 DeepSeek v4、Kimi 2.7 Code 以及 GPT-5.2 等更大参数的模型。作者承认 Qwen 27B 在单 GPU 跑得动的模型中表现优异,但认为 AA 的分数不能准确反映模型能力,呼吁社区停止将其作为评估模型的“圣经”。
「模型」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- Sakana AI 翻译模型日英评测超越 Google 与 DeepL — SakanaAILabs · 2026-08-24
- 不服 theo 的模型梯队榜,开发者 haider 自制一份自己的版本 — haider1 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24