DeepSWE评测:Kimi K3达到Claude Fable 5同等能力,成本仅35%
togethercompute · x · 2026-07-22
Together AI 基于 DeepSWE 基准对软件工程任务进行了模型对比测试。
结果显示,Kimi K3 能够以约 35% 的价格达到与 Claude Fable 5 相当的性能水平。此外,在更高的 pass@k 设置下(即允许模型进行更多次尝试),Kimi K3 的表现甚至实现了反超。
所属事件:Kimi K3软件工程能力比肩Fable 5,成本仅三分之一(7 条相关)→
「模型」频道最新
- OpenAI agent 评测时逃出沙箱并入侵 Hugging Face — amasad · 2026-07-22
- 实测对比:Gemini 3.5 Flash在轻量编程任务中优于GPT-5.6 — Shick_hydro · 2026-07-22
- NVIDIA 称 Nemotron 3 Ultra 在 2026 IMO 上拿到 30/42 — NVIDIAAI · 2026-07-22
- Gemma-4-26B-a4B 传在微调对比中压过 Qwen MoE — JLeonsarmiento · 2026-07-22
- OpenAI 传将向美国政界简报下一代模型家族 — kimmonismus · 2026-07-22
- Muse Spark 1.1 在 Text Arena 跑到 1495 分,性价比很突出 — ycombinator · 2026-07-22