盲测文档基准显示 Kimi K3 追平 Sol 的 Word 表现
ell-hol1 · reddit · 2026-07-21
Kimi K3 在文档写作上逼近 GPT-5.6 Sol,但演示文稿仍明显落后
这条帖介绍的是一个 Reddit 社区参与的盲测基准 DocBench Arena:400+ 名 Reddit 用户对 236 个生成文件投了 3,000+ 票,用来比较不同模型生成文档和演示的质量。
- 综合榜单:GPT-5.6 Sol 仍是第 1,ELO 1306;Kimi K3 首次进入榜单,排到第 6,ELO 1192。
- PPT/Slides:Sol 以 1373 排第 1,K3 只有 1181,差距很大。
- Word 文档:K3 的 1214 几乎追平 Sol 的 1211,基本可以看作打平。
- 成本:K3 每份完成文档约 $0.44,低于 Sol 的 $0.56。
- 速度:Sol 大约 2 分钟完成任务,K3 约慢 5 倍,同时消耗更多 token 和 agent step。
作者的结论是:Sol 依然是总体最强,尤其在演示文稿和效率上优势明显;但 K3 已经在 Word 文档这一半的基准上找到突破口,做到几乎同质量、但更便宜。只是目前 K3 的比较样本还少,只有 186 次对比,后续排名仍可能变化。
「模型」频道最新
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 开源 LLM 排行榜与定价对照目录,一站式索引比较工具 — Last_Establishment_1 · 2026-09-11