Qwen 2.5 模型评测异常值引发争议
RokoMijic · x · 2026-08-19
Roko Mijic 根据 Artificial Analysis 的数据制作图表,显示 Qwen 2.5 (27B) 在同等参数规模下性能表现远超其他模型,被称为异常值。然而,该图表的真实性及基准测试的选择标准引发了质疑,评论认为这可能存在挑选特定基准以夸大表现的情况。
所属事件:Qwen 2.5 评测异常高分引发基准选择争议(4 条相关)→
「模型」频道最新
- 研究者实测:ChatGPT Ultra 长任务表现已超越 Pro 模式 — arankomatsuzaki · 2026-08-24
- 吐槽Google:Gemini 3.7发布一周仍未接入自家Jules智能体 — brandon_galang · 2026-08-24
- Qwen 27B 3.8 极低量化实测:Q3 XXS 可用 — jeremyckahn · 2026-08-24
- 用户反馈 GPT-5.6 近期输出质量显著变化 — haider1 · 2026-08-24
- Ramp 统计 Anthropic 模型使用占比:Opus 4.8 最受青睐 — vista8 · 2026-08-24
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24