Kimi K3 刷榜 AA-Briefcase 但成本高耗时长

Artificial Analysis 针对 Kimi K3 在 AA-Briefcase 代理知识工作基准上的表现发布了多维度评测。评测显示,Kimi K3 虽然在总分上取得了前沿成绩,但在运行效率与成本消耗上付出了极高的代价,呈现出显著的优劣势分化。

核心成绩与能力偏科

Kimi K3 在 AA-Briefcase 测试中拿到了 1543 Elo 的总分,排名第二,逼近榜单顶级模型。在具体维度上,其分析质量表现强劲,达到 1754 Elo,大致相当于 Claude 的水平;但呈现质量明显弱于其自身的分析能力,存在偏科现象。

运行成本与效率代价

尽管分数亮眼,但 Kimi K3 的运行代价极为高昂。平均每个任务耗时高达 56.4 分钟,是榜单中耗时最长的一档;单任务平均成本也达到 10.57 美元(在展示模型中仅次于 14.43 美元的 Claude Sonnet 5 max 版本)。导致成本和耗时暴增的主要原因是,该模型在处理任务时平均需要 83 轮交互,并产生约 12 万的输出 Token。

2026-07-22 ~ 2026-07-22 · 5 条相关