盲测文档基准显示 Kimi K3 追平 Sol 的 Word 表现
ell-hol1 · reddit · 2026-07-21
Kimi K3 在文档写作上逼近 GPT-5.6 Sol,但演示文稿仍明显落后
这条帖介绍的是一个 Reddit 社区参与的盲测基准 DocBench Arena:400+ 名 Reddit 用户对 236 个生成文件投了 3,000+ 票,用来比较不同模型生成文档和演示的质量。
- 综合榜单:GPT-5.6 Sol 仍是第 1,ELO 1306;Kimi K3 首次进入榜单,排到第 6,ELO 1192。
- PPT/Slides:Sol 以 1373 排第 1,K3 只有 1181,差距很大。
- Word 文档:K3 的 1214 几乎追平 Sol 的 1211,基本可以看作打平。
- 成本:K3 每份完成文档约 $0.44,低于 Sol 的 $0.56。
- 速度:Sol 大约 2 分钟完成任务,K3 约慢 5 倍,同时消耗更多 token 和 agent step。
作者的结论是:Sol 依然是总体最强,尤其在演示文稿和效率上优势明显;但 K3 已经在 Word 文档这一半的基准上找到突破口,做到几乎同质量、但更便宜。只是目前 K3 的比较样本还少,只有 186 次对比,后续排名仍可能变化。
「模型」频道最新
- Gemini 3.6 Flash 疑似已上线,输入价 1.50 美元 — ivan_bezdomny · 2026-07-21
- Artificial Analysis 更新榜单,Gemini 3.6 Flash 得 50 分 — Angaisb_ · 2026-07-21
- 谷歌悄上 Gemini 3.6 Flash,输出价还降了 — xiaohu · 2026-07-21
- Google 又发三款 Gemini,3.5 Pro 再次跳票 — Miserable-Archer-631 · 2026-07-21
- 谷歌静默上线 Gemini 3.6 Flash,更强且降价,主打智能体任务 — OwariDa · 2026-07-21
- 有人称 Claude 的 10 小时活相当于 Grok Build 的 3 小时 — Daniel_Farinax · 2026-07-21