Fireworks 测试 Kimi K3:663 个编码任务里质量接近 Opus 5
lqiao · x · 2026-07-28
Fireworks 对比 Kimi K3 与 Opus 5:质量接近,按任务计更便宜
- Fireworks 用 663 个 agentic coding 任务做了对比,覆盖 SWE(480)、Algorithmic(100) 和 Terminal(83) 三类任务。
- 结果显示两者任务级质量很接近,Opus 5 在整体准确率上略高,平均分为 92.6,Kimi K3 为 90.6。
- 但如果按 per-task cost 计算,Kimi K3 明显更省:
- SWE:$0.52 vs $1.05,便宜 2.0x
- Algorithmic:$0.064 vs $0.18,便宜 2.8x
- Terminal:$0.35 vs $1.61,便宜 4.6x
- 平均:$0.43 vs $0.99,便宜 2.3x
- Fireworks 强调,衡量这类模型更应该看 按任务成本,而不是按 token 成本,因为开源模型往往输出更长。
- 他们还表示会继续通过 Fireworks Inference 提升推理效率,并通过 Fireworks Training 提升质量。
所属事件:Fireworks实测Kimi K3质量接近Opus 5,成本低2至4.6倍(5 条相关)→
「编程与Agent」频道最新
- 有人把 Codex in Chat 跑 12 小时当作 agent 典型案例 — ctjlewis · 2026-07-28
- 补充一句:行业从 2024 年一季度就在推“Agents™” — ctjlewis · 2026-07-28
- Vibe coding 也能快速做个人 Chrome 扩展 — tomchapin · 2026-07-28
- Salesforce 给 Data 360 加上 Code Extension 和 Claude Code — msrivastav13 · 2026-07-28
- OpenAI agent 演示、开源权重潮与 AI 碳成本重塑企业判断 — jonerp · 2026-07-28
- ChatGPT 已有 agent 行为,但“Agents™”更像包装概念 — ctjlewis · 2026-07-28