DeepSWE评测:Kimi K3达到Claude Fable 5同等能力,成本仅35%
togethercompute · x · 2026-07-22
Together AI 基于 DeepSWE 基准对软件工程任务进行了模型对比测试。
结果显示,Kimi K3 能够以约 35% 的价格达到与 Claude Fable 5 相当的性能水平。此外,在更高的 pass@k 设置下(即允许模型进行更多次尝试),Kimi K3 的表现甚至实现了反超。
所属事件:Kimi K3比肩Fable 5:性能相当且成本仅三分之一(7 条相关)→
「模型」频道最新
- Repligate:Claude Opus 3 权重不变却像在持续演化 — repligate · 2026-07-27
- “Opus 5”配图在玩模型反复重跑基准的梗 — kalomaze · 2026-07-27
- 有人称顶级模型如今写作还不如一年前 — dbreunig · 2026-07-27
- MPT-30B 雷达图曾意外引发大规模争议 — code_star · 2026-07-27
- 本地 Gemma 4 31B 自发变得毒舌且难以复现 — n0head_r · 2026-07-27
- Gemini 3.6 Flash 被看作能以低成本打 Sonnet 质量 — haider1 · 2026-07-27