Fireworks 测试 Kimi K3:663 个编码任务里质量接近 Opus 5
lqiao · x · 2026-07-28
Fireworks 对比 Kimi K3 与 Opus 5:质量接近,按任务计更便宜
- Fireworks 用 663 个 agentic coding 任务做了对比,覆盖 SWE(480)、Algorithmic(100) 和 Terminal(83) 三类任务。
- 结果显示两者任务级质量很接近,Opus 5 在整体准确率上略高,平均分为 92.6,Kimi K3 为 90.6。
- 但如果按 per-task cost 计算,Kimi K3 明显更省:
- SWE:$0.52 vs $1.05,便宜 2.0x
- Algorithmic:$0.064 vs $0.18,便宜 2.8x
- Terminal:$0.35 vs $1.61,便宜 4.6x
- 平均:$0.43 vs $0.99,便宜 2.3x
- Fireworks 强调,衡量这类模型更应该看 按任务成本,而不是按 token 成本,因为开源模型往往输出更长。
- 他们还表示会继续通过 Fireworks Inference 提升推理效率,并通过 Fireworks Training 提升质量。
所属事件:Fireworks 实测:Kimi K3 质量接近 Opus 5 且成本大降(5 条相关)→
「编程与Agent」频道最新
- 受 OpenAI 万机群启发,开发者开源 agent 众包解题平台 — Benjaminsen · 2026-09-11
- 开源 Mac 应用 Lucid:只在跑 AI 时阻止笔记本休眠 — Pitiful_Hedgehog_600 · 2026-09-11
- 20kb 函数匹配达成,banteg 召集 AI 逆向 Snail Mail 剩余 20 个挑战 — banteg · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11