Kimi K3 Max 智能体实测:单美元解决任务数达 2.8 倍

togethercompute · x · 2026-08-03

Together Compute 发布了对 Kimi K3 Max 模型在 DeepSWE 基准上的分析结果。数据显示,Kimi K3 Max 在 Pass@1 成绩上接近 Fable 5 xhigh 模型,但每次部署的成本仅为后者的三分之一。

这使得该模型在单美元能够解决的任务数量上达到了竞品的 2.8 倍。对于需要大规模运行模型的技术团队来说,单任务成本往往是比单纯性能更有用的衡量指标。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →