Kimi 报告披露覆盖编程与 Agent 的内部评测体系

stochasticchasm · x · 2026-07-28

配图展示的是 Kimi 报告里的内部评测章节。文中说,团队除了公开 benchmark 之外,还维护了一套规模更大的自研评测集,用来持续追踪模型的失败模式,并反过来指导数据和训练迭代。

这些 benchmark 大致分成三类:

作者的意思是,这套内部 benchmark 覆盖面很广,足以暴露模型能力短板;如果其中一些能公开,会对外界理解模型很有帮助。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →