Kimi K3 Max 登顶 Arena 榜首,前端与 Agent 任务全面领先
arena · x · 2026-07-28
在最新一期的 Arena 榜单中,Moonshot 的 Kimi K3 (Max) 表现抢眼,不仅拿下开源模型第一,更在总榜登顶。
- 前端代码能力:在全部 7 个细分领域中均位列开源第一;总榜上在 7 个领域中的 5 个夺得第一,仅在游戏和内容创作工具中略逊。
- Agent 能力:以 +9.75% 的净提升得分位居 Agent Arena 第一,超越 GLM-5.2 (Max) 的 +7.12%。
- 评测机制:Agent Arena 通过让模型调用网页搜索、文件系统和终端工具来完成真实的长线复杂任务(如写代码、做 PPT、分析文档等),并采用因果追踪方法来衡量模型对最终结果的净提升效果。
所属事件:Kimi K3 登顶 Agent Arena 榜单,多项任务领跑开源模型(4 条相关)→
「模型」频道最新
- Kimi K3 报告披露内核优化、编译器和芯片原型 — stochasticchasm · 2026-07-28
- Kimi 报告披露覆盖编程与 Agent 的内部评测体系 — stochasticchasm · 2026-07-28
- Claude 仍被称为最可控的模型集,尽管它很怪 — sloppenheimer · 2026-07-28
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28
- Kimi K3 上线 Hugging Face 推理 API,输出价格 15 美元/百万 tokens — mervenoyann · 2026-07-28
- OpenRouter 将 GPT-5.6 Terra 和 Luna 价格砍半 — OpenAIDevs · 2026-07-28