实测:Kimi K3 编码能力比肩 Opus,登顶开源模型
sergeykarayev · x · 2026-08-01
在自定义的 SWE-bench 测试中,Kimi K3 在特定 Rails 代码库上的表现达到了 Opus 4.8 的水平,且成本远低于后者。
对比其他开源模型,Kimi K3 领先 GLM 5.2 约 8 个百分点,成为当前最强的开源权重模型。
所属事件:实测Kimi K3编码能力比肩Opus登顶开源(2 条相关)→
「编程与Agent」频道最新
- claude-pulse: 实时监控 Claude Code 额度的状态栏工具 — tom_doerr · 2026-08-01
- 滑铁卢大学 R2L 实验室将招募 PhD,深耕智能体与推理研究 — hllo_wrld · 2026-08-01
- AI 编程助手自己找客服报 Bug,智能体自主工作流初现 — ___Patrice___ · 2026-08-01
- AgentIR:让深度搜索智能体学会利用推理上下文 — hllo_wrld · 2026-08-01
- 将 Computer-use 点击延迟降至 10ms 以下:云端沙箱架构优化实践 — charles_irl · 2026-08-01
- 开发者开源 Helix-agi 多智能体办公套件,基于本地小模型实现零成本自动化 — LowDistribution3995 · 2026-08-01