Kimi 报告披露覆盖编程与 Agent 的内部评测体系
stochasticchasm · x · 2026-07-28
配图展示的是 Kimi 报告里的内部评测章节。文中说,团队除了公开 benchmark 之外,还维护了一套规模更大的自研评测集,用来持续追踪模型的失败模式,并反过来指导数据和训练迭代。
这些 benchmark 大致分成三类:
- 编程能力与体验:Kimi Code Bench 2.0、Kimi Webdev Bench,以及真实开发流程中的 coding agent 体验。
- 通用 agent 体验:24/7 ClawBench 2.0、MIRA Bench、KAET、CLIF、Agentic Vision Bench、Swarm Bench、Online Experience。
- 对话体验:作为整体评测体系的一部分。
作者的意思是,这套内部 benchmark 覆盖面很广,足以暴露模型能力短板;如果其中一些能公开,会对外界理解模型很有帮助。
「模型」频道最新
- Kimi K3 报告披露内核优化、编译器和芯片原型 — stochasticchasm · 2026-07-28
- Claude 仍被称为最可控的模型集,尽管它很怪 — sloppenheimer · 2026-07-28
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28
- Kimi K3 Max 登顶 Arena 榜首,前端与 Agent 任务全面领先 — arena · 2026-07-28
- Kimi K3 上线 Hugging Face 推理 API,输出价格 15 美元/百万 tokens — mervenoyann · 2026-07-28
- OpenRouter 将 GPT-5.6 Terra 和 Luna 价格砍半 — OpenAIDevs · 2026-07-28