Kimi K3 对比 Opus 5:任务级质量相当,成本便宜 2-4.6 倍
lqiao · x · 2026-07-28
Fireworks AI 基于 SWE、算法和终端等实际业务场景,对 Kimi K3 和 Opus 5 进行了基准对比。
- 评测维度:核心衡量指标为「任务级成本」而非 token 级成本,因为开源模型通常比闭源模型更冗长。
- 质量与成本:在 SWE (480项)、算法 (100项) 和终端 (83项) 测试中,两者的任务级质量非常接近,Opus 5 持平或略占优;但在 Serverless 定价下,K3 的单任务成本比 Opus 5 便宜 2 到 4.6 倍。
- 后续目标:团队计划通过 Fireworks Inference 持续提升单任务服务效率,并通过 Fireworks Training 优化模型质量。
所属事件:实测显示 Kimi K3 质量媲美 Opus 5 且成本大幅降低(4 条相关)→
「模型」频道最新
- Kimi K3 上线 Together AI,3万亿参数 MoE 支持百万上下文 — zainhas · 2026-07-28
- Fireworks 测试 Kimi K3:663 个编码任务里质量接近 Opus 5 — lqiao · 2026-07-28
- 传闻称 Anthropic 有更大的内部教师模型,公开版也接近 K3 — teortaxesTex · 2026-07-28
- Kimi 报告披露覆盖编程与 Agent 的内部评测体系 — stochasticchasm · 2026-07-28
- Claude 仍被称为最可控的模型集,尽管它很怪 — sloppenheimer · 2026-07-28
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28