Kimi K3 实测输出很强,但推理 token 让真实成本达到 Opus 的 2–3 倍
Tarandjpop · reddit · 2026-07-21
一位 Reddit 用户用一天时间,在接近生产环境的图像生成/编辑工作流里对比了 Kimi K3 和 Claude Opus。
要点是:
- Kimi K3 在成功完成任务时,输出质量很高
- API 使用里 推理 token 占比非常大,约占 70%–80%
- 某些长任务端到端耗时接近 1 小时
- 在这个工作流里,实际成本常常是 Opus 的 2–3 倍
- 长请求迫使他们调整基础设施:流式传输、更多 token 预算、更长连接保持时间
- 最大问题不是模型本身,而是高峰期频繁出现 429 / 容量限制
作者认为 Kimi K3 的上限很高,但在当前工作流里,延迟、基础设施要求和真实成本仍有明显代价。配图则是在一个类游戏场景里对比 Kimi K3、Opus 和 GPT-5.6 Sol 的表现与成本。
所属事件:实测 Kimi K3 输出上限高但推理成本远超 Opus(2 条相关)→
「模型」频道最新
- Google 推出 Gemini 3.5 Flash Cyber,限量供政府和可信伙伴使用 — GoogleAI · 2026-07-22
- Kimi K3 在四项公开基准上都领先 Gemini 3.6 Flash — ChrisGPT · 2026-07-22
- Google 停更基础模型超一年,引发外界强烈批评 — teortaxesTex · 2026-07-22
- 当前是 8192 输入、2048 输出,下一步改成 8k/512 — TheZachMueller · 2026-07-22
- Kimi K3 比 K2.7 更慢,但重度编码和长迁移更强 — Far-Presence2711 · 2026-07-22
- Poolside 发布 Laguna S 2.1:118B 规模、8B 激活参数、瞄准代理编程 — Madisonkanna · 2026-07-22