质疑声起:AA 被指挑基准,Qwen3 27B 高分或被夸大
taoeffect · x · 2026-08-19
taoeffect 对近日热传的「Qwen 3 27B 智能远超尺寸」的说法提出质疑:Artificial Analysis 只挑选了少数人关心的两个基准并只展示这些图表,大量用户将其当作定论传播,却未看全量基准数据。
他认为这是对基准的选择性使用——模型本身确实不错,但被挑选的基准放大了其实力,使其「看起来比实际更惊艳」。回应中也有人建议直接在本地跑 8-bit 版本(48GB 显存即可)亲自验证。
所属事件:Qwen 2.5 评测异常高分引发基准选择争议(4 条相关)→
「模型」频道最新
- Claude 隐形水印发布数小时即被破解,绕过代码获两万收藏 — deliprao · 2026-08-24
- Sonnet 4.5 与 Opus 3 对话时出现密集怪异行为 — repligate · 2026-08-24
- 有人整理了一份全面的 AI 模型排行榜 — FinanceYF5 · 2026-08-24
- 用户实测 LTX 模型乐器生成能力优于 H3 — cocktailpeanut · 2026-08-24
- 15款主流AI模型排梯队:Fable 5 S+,Kimi K3 B档 — FinanceYF5 · 2026-08-24
- 视频生成占中国 AI 算力 70%,中美发展路径迥异 — AccBalanced · 2026-08-24