AAI 数据性价比分析:Luna 领跑,Qwen 3.8 27B 排第四
8 月 20 日,MikePFrank 连发多条帖子,基于 AAI(Artificial Analysis)Index 的公开数据对模型「性价比」(智力指数得分除以单任务成本)进行排名分析,并在此过程中修正了自己的计算方法。
已确认
- 在得分不低于 Qwen 3.8 27B 的模型中,Luna 是单位成本效率最高的模型,DeepSeek V4 Flash 紧随其后,刚发布的 Qwen-3.8 27B 在该指标下排名第四。
- Qwen-3.8 27B 的独特优势在于它是榜单中唯一可在笔记本上本地运行的模型,是「笔记本独苗」。
- 作者更正了「单位成本智能体指数」的计算列,指出应基于该指数的单次测试成本重新计算,更新后的数据表格仅影响少数模型的排序。
- 在基于 AA 数据绘制的 Agent 成本效率帕累托前沿图中,Qwen-3.8 27B 落在前沿线上,而 Claude 没有。
- AAI 提供了智力指数得分与成本的帕累托前沿图表。
为什么重要
- 作者认为,帕累托前沿图比单纯的排名更能直观展示模型在性能与开销之间的权衡,对开发者在不同预算下选型更有参考价值。
- 该分析将「可本地部署」这一维度纳入性价比讨论,凸显了 Qwen-3.8 27B 这类小尺寸模型对本地开发者的意义。
2026-08-20 ~ 2026-08-20 · 5 条相关
一手来源
- 性价比榜单:Luna 领跑,Qwen 27B 笔记本独苗 — MikePFrank ·
- Agent 性价比图:Qwen 登顶 Pareto 前沿 — MikePFrank ·
- 【源头】性价比榜单:Luna 领跑,Qwen 27B 笔记本独苗 — MikePFrank · 2026-08-20
- Luna 仍最划算,Qwen 3.8 27B 性价比排第四 — MikePFrank · 2026-08-20
- AAI 公布智力指数得分与成本的帕累托前沿 — MikePFrank · 2026-08-20
- 修正智能体评测:引入单次测试成本与帕累托前沿分析 — MikePFrank · 2026-08-20
- 【源头】Agent 性价比图:Qwen 登顶 Pareto 前沿 — MikePFrank · 2026-08-20