质疑声起:AA 被指挑基准,Qwen3 27B 高分或被夸大

taoeffect · x · 2026-08-19

taoeffect 对近日热传的「Qwen 3 27B 智能远超尺寸」的说法提出质疑:Artificial Analysis 只挑选了少数人关心的两个基准并只展示这些图表,大量用户将其当作定论传播,却未看全量基准数据。

他认为这是对基准的选择性使用——模型本身确实不错,但被挑选的基准放大了其实力,使其「看起来比实际更惊艳」。回应中也有人建议直接在本地跑 8-bit 版本(48GB 显存即可)亲自验证。

所属事件:Qwen 2.5 评测异常高分引发基准选择争议(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →