Kimi K3 登顶表格评测
rohanpaul_ai · x · 2026-07-18
Kimi K3 在 SpreadsheetBench 2 上拿到第一名,表现被描述为对电子表格工作流特别有用,尤其适合金融、规划和运营场景。
这个基准不是只看单点公式能力,而是测试工具型 AI 是否能完成完整表格任务。它包含 321 个专家设计任务,覆盖财务建模、工作簿调试和原生图表创建;任务平均有 11.8 个工作表和 593.5 次单元格修改,要求模型在长链路操作中保持上下文一致。
帖子还说明了评分方式:
- 建模和调试任务要求所有指定修改都准确完成,同时未要求修改的单元格不能被误改
- 图表任务只有在视觉模型确认满足至少 70% 的要求时才算通过
引用内容补充称,Kimi K3 超过了 Claude Fable 5,并称这是一个开权重模型击败所有闭源模型的结果。
所属事件:Kimi K3登顶表格评测,KernelBench早期表现亮眼(4 条相关)→
「模型」频道最新
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11