Kimi K3 逼近 AA-Briefcase 榜首,但呈现分明显落后
ArtificialAnlys · x · 2026-07-22
Artificial Analysis 用 AA-Briefcase 从三个维度评测模型:二元正确性、分析质量和呈现质量。Kimi K3 的总分很强,但呈现质量明显弱于它的分析能力。
- 分析质量 Elo:1754,大致相当于 Claude Fable 5 的 1744。
- 呈现质量 Elo:1471,低于一些总分排在它后面的模型,包括 GPT-5.6 Sol(max)和 Claude Opus 4.8(max)。
- AA-Briefcase 的总 Elo 会把正确性、分析质量、呈现质量综合起来。
- 线程补充指出:Kimi K3 在 AA-Briefcase 上仅次于 Fable 5,但运行成本比 Opus 4.8 还高,而且平均每个任务接近一小时。
所属事件:Kimi K3 刷榜 AA-Briefcase 但成本高耗时长(5 条相关)→
「模型」频道最新
- 有人吐槽:小算力模型预训练截止到 2025 年 1 月 太离谱 — _arohan_ · 2026-07-22
- Qwen3.8 预览版把阿里开源权重推向企业分发 — krishnan · 2026-07-22
- Google 今天据称放出几款模型,后续还会更多 — bindureddy · 2026-07-22
- 本地模型单提示生成飞行模拟器,6 款模型同台实测 — JLeonsarmiento · 2026-07-22
- poolside 的 Laguna-S-2.1-GGUF 登上 Hugging Face 趋势榜 — poolside · 2026-07-22
- 一组基准图对比 GPT-5.6 Sol、Gemini 3.6 Flash 和 Kimi K3 — andersonbcdefg · 2026-07-22