Kimi K3 报告补充内测表,覆盖编码与 WebDev 评测
nrehiew_ · x · 2026-07-29
这条补充帖继续放出了 Kimi K3 报告里的两张表。
内部 benchmark 表
表格把 Kimi K3 (max) 和多款闭源/开源模型放在一起,对比了 coding、agent 和对话能力。几个重点是:
- Coding Experience:Kimi K3 在 Claude Code 和 Codex 两套 harness 下都表现不差。
- General Agent Experience:在 24/7 ClawBench 2.0、MIRA Bench、KAET、CLIF Bench、Agentic Vision Bench、Swarm Bench、Online Experience、Deep Research Bench、Finance Bench、KWV Bench、DECK Bench、Agent Behavior Bench 等项目上都有结果。
- Conversational Experience:在 Faithfulness 和 Chat All-in-One Bench 上也有比较强的成绩。
WebDev bench
第二张表是 Kimi K3 (max) 对 Claude Opus 4.8 (max) 的盲测对比,维度包括:
- Games
- 3D / WebGL / Shader
- Website / UI Clone
- Overall
报告说明,专家在不知道模型来源的情况下,从代码质量、功能完整性、视觉还原度和交互体验等方面打分。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「Infra」频道最新
- Polymarket 预测州级数据中心禁令年底前概率 60% — Polymarket · 2026-07-29
- NextEra 与 Brookfield 在肯塔基州规划超 1000 亿美元 AI 数据中心园区 — Polymarket · 2026-07-29
- 8 美元 ESP32-S3 跑起 2890 万参数离线模型 — nikola_mr64990 · 2026-07-29
- 高通宣布已完成对 Modular 的收购 — clattner_llvm · 2026-07-29
- AMD 2026 印度 AI 开发者日聚焦智能体、本地 AI 与视频生成 — PyTorch · 2026-07-29
- Meta 可能用首个 compute client 消息配合加码 CapEx — RihardJarc · 2026-07-29