Kimi K3 代码榜登顶
koltregaskes · x · 2026-07-19
Moonshot 的 Kimi K3 在上线后不久就登上了 Arena 的前端代码榜首,盲测中超过了 Claude Fable 5 和 GPT-5.6 Sol。帖子还引用 DeepSWE、Artificial Analysis 等结果:K3 在长上下文编码、知识工作和核优化测试里表现接近或逼近最前沿,同时在不少指标上更便宜。\n\n作者强调它的取舍是更强的长程编码能力 + 更低单任务成本,代价则是默认推理更“啰嗦”,实际成本会受输出 token 数影响;独立测试还显示它存在较高幻觉率。Moonshot 计划在 7 月 27 日放出 open weights,帖子的核心判断是:中文开放权重模型在部分前沿编码场景里已经开始真正逼近头部闭源模型。
所属事件:Kimi K3 登顶前端代码榜,编程能力逼近 Fable 5(12 条相关)→
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11