Kimi K3 实测输出很强,但推理 token 让真实成本达到 Opus 的 2–3 倍
Tarandjpop · reddit · 2026-07-21
一位 Reddit 用户用一天时间,在接近生产环境的图像生成/编辑工作流里对比了 Kimi K3 和 Claude Opus。
要点是:
- Kimi K3 在成功完成任务时,输出质量很高
- API 使用里 推理 token 占比非常大,约占 70%–80%
- 某些长任务端到端耗时接近 1 小时
- 在这个工作流里,实际成本常常是 Opus 的 2–3 倍
- 长请求迫使他们调整基础设施:流式传输、更多 token 预算、更长连接保持时间
- 最大问题不是模型本身,而是高峰期频繁出现 429 / 容量限制
作者认为 Kimi K3 的上限很高,但在当前工作流里,延迟、基础设施要求和真实成本仍有明显代价。配图则是在一个类游戏场景里对比 Kimi K3、Opus 和 GPT-5.6 Sol 的表现与成本。
所属事件:实测 Kimi K3 输出上限高但推理成本远超 Opus(2 条相关)→
「模型」频道最新
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11
- 网友吐槽 GPT-5.6 文笔好读但缺乏记忆点 — BasedRaddka · 2026-09-11
- Opus 以"安全"为由拒碰蛋白质生成代码,开发者吐槽误伤 — josephdviviano · 2026-09-11
- 网友称 DeepSeek 4.1 Flash 是语言模型历史拐点(未证实) — himanshustwts · 2026-09-11