Kimi K3 刷榜 AA-Briefcase 但成本高耗时长
Artificial Analysis 针对 Kimi K3 在 AA-Briefcase 代理知识工作基准上的表现发布了多维度评测。评测显示,Kimi K3 虽然在总分上取得了前沿成绩,但在运行效率与成本消耗上付出了极高的代价,呈现出显著的优劣势分化。
核心成绩与能力偏科
Kimi K3 在 AA-Briefcase 测试中拿到了 1543 Elo 的总分,排名第二,逼近榜单顶级模型。在具体维度上,其分析质量表现强劲,达到 1754 Elo,大致相当于 Claude 的水平;但呈现质量明显弱于其自身的分析能力,存在偏科现象。
运行成本与效率代价
尽管分数亮眼,但 Kimi K3 的运行代价极为高昂。平均每个任务耗时高达 56.4 分钟,是榜单中耗时最长的一档;单任务平均成本也达到 10.57 美元(在展示模型中仅次于 14.43 美元的 Claude Sonnet 5 max 版本)。导致成本和耗时暴增的主要原因是,该模型在处理任务时平均需要 83 轮交互,并产生约 12 万的输出 Token。
2026-07-22 ~ 2026-07-22 · 5 条相关
- 【源头】Kimi K3 代理基准第二,但每任务成本 10.57 美元 — ArtificialAnlys · 2026-07-22
- 【源头】Kimi K3 逼近 AA-Briefcase 榜首,但呈现分明显落后 — ArtificialAnlys · 2026-07-22
- Kimi K3 分数逼近顶级,但 AA-Briefcase 单任务要 10.57 美元 — ArtificialAnlys · 2026-07-22
- 【源头】Kimi K3 刷榜 AA-Briefcase,但每任务要 56.4 分钟 — ArtificialAnlys · 2026-07-22
- Kimi K3 评测:单任务耗时 56 分钟,Token 消耗暴增 — ArtificialAnlys · 2026-07-22