Kimi K3 在四项公开基准上都领先 Gemini 3.6 Flash
ChrisGPT · x · 2026-07-22
Kimi K3 在四项共享基准上都压过 Gemini 3.6 Flash
这条帖子给出一张对比图,称 Kimi K3(被描述为开源模型)在与 Google Gemini 3.6 Flash 重叠的公开 benchmark 上全部领先。
- DeepSWE v1.1:67.5% 对 49.0%,领先 18.5
- Terminal-Bench 2.1:88.3% 对 78.0%,领先 10.3
- GDPVal-AA v2:1668 对 1421,领先 247
- CharXiv Reasoning:91.3% 对 89.4%,领先 1.9
帖子强调的结论是:Kimi K3 在代码、终端 agent、知识任务和图表推理四类公开评测里都占优。
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- Terminal Bench v4 榜单:GLM-5.3 以 41.9% 一骑绝尘 — Ok_Warning2146 · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11