Fireworks 实测:Kimi K3 质量接近 Opus 5 且成本大降
Fireworks AI 对 Kimi K3 与 Claude Opus 5 进行了详细的对比测试,发现在智能体编码场景中,Kimi K3 的任务质量接近 Opus 5,且单任务成本低 2 到 4.6 倍。该结论为开源模型在实际业务场景中的性价比优势提供了有力证据。
已确认
- 测试基于 663 个 agentic coding 任务,具体涵盖 SWE(480个)、Algorithmic(100个)和 Terminal(83个)三个基准测试。
- 在任务完成质量方面,Opus 5 与 K3 持平或略占优势。
- 在成本方面,Fireworks 采用了“任务级成本”而非“token 级成本”作为核心衡量指标,因为开源模型通常比闭源模型输出更冗长。
- 按此口径,Kimi K3 的单任务成本仅为 Opus 5 的四分之一到二分之一(即便宜 2 到 4.6 倍)。
为什么重要
在编码与智能体场景中,模型输出的冗长度会显著影响最终的 token 消耗与使用成本。此次评测直接切入“任务级成本”,更真实地反映了实际业务落地的开销。Kimi K3 展现出的高质量与极低任务成本,表明开源模型在特定工作负载下已具备极强的商业竞争力。
2026-07-28 ~ 2026-07-28 · 5 条相关
- 第 1 集:Kimi K3 登顶前端 Web App 榜单并获英文能力好评(2026-07-21,3 条)
- 第 2 集:Kimi K3 跃升至 Agent Arena 第 4 名(2026-07-21,6 条)
- 第 3 集:Moonshot 发布 2.8 万亿参数开源模型 Kimi K3(2026-07-21,8 条)
- 第 4 集:Kimi K3比肩Fable 5:性能相当且成本仅三分之一(2026-07-21,7 条)
- 第 5 集:Kimi K3 创开源模型 ECI 指数新高但仍有代差(2026-07-22,3 条)
- 第 6 集:研究称Kimi K3具有评测意识,被指刷题(2026-07-22,2 条)
- 第 7 集:Kimi K3 刷榜 AA-Briefcase 但成本与耗时高昂(2026-07-22,6 条)
- 第 8 集:Kimi K3 横评表现亮眼跻身全球顶级模型梯队(2026-07-22,4 条)
- 第 9 集:Kimi K3 公开后焦点转向架构(2026-07-27,25 条)
- 第 10 集:TokenSpeed实现Kimi K3双平台首发支持(2026-07-27,2 条)
- 第 11 集:Moonshot Kimi K3首发上线Nebius,支持百万上下文(2026-07-27,3 条)
- 第 12 集:SGLang首发支持Kimi K3,吞吐量飙升至423 tok/s(2026-07-28,8 条)
- 第 13 集:月之暗面Kimi K3旗舰模型在Together AI首发上线(2026-07-28,12 条)
- 第 14 集:Kimi K3 Max 登顶多项 Arena 榜单,开源模型比肩闭源(2026-07-28,11 条)
- 第 15 集:Fireworks 实测:Kimi K3 质量接近 Opus 5 且成本大降(2026-07-28,5 条)
- 第 16 集:Kimi K3早期测试表现亮眼引发社区热议(2026-07-28,3 条)
- 第 17 集:Kimi K3 本地实测胜出,3D 物理场景击败多款云端模型(2026-07-28,5 条)
- 第 18 集:Kimi K3技术报告深度拆解:工程协同成就前沿性能(2026-07-28,21 条)
- 第 19 集:月之暗面 Kimi K3 登陆日本(2026-07-28,2 条)
- 第 20 集:Kimi K3 通过 Compound 基准但缓存命中率被指拖累成本(2026-07-29,2 条)
一手来源
- Fireworks:Kimi K3 任务质量接近 Opus 5,成本低 2 到 4.6 倍 — lqiao · 2026-07-28
- 【源头】Fireworks 测试 Kimi K3:663 个编码任务里质量接近 Opus 5 — lqiao · 2026-07-28