Kimi K3 上线冲榜,开权重逼近前沿

月之暗面的新模型 Kimi K3 在 7 月 16 日前后开始出现在网页端和 App 端,并迅速因参数规模、上下文长度和榜单表现引发集中讨论。多条帖子把它描述为一款拥有 2.8T 参数、1M 上下文、面向 coding、agentic tasks、长程推理与视觉理解的模型。之所以值得关注,不只因为分数高,还因为它被不少人视为开权重模型再次逼近前沿闭源模型的信号,同时也暴露出稳定性与成本的现实取舍。

已披露信息

根据帖子转述的页面信息,K3 主打代码、智能体、长上下文推理和视觉能力。Artificial Analysis 给出的 Intelligence Index 分数为 57;其官方帖还称,K3 相比 K2.6 提升 13 分,但成本约增加 3 倍。多条帖子据此解读其已跻身榜单前列,并超过 Claude Opus 4.8;同一轮讨论里,它也被描述为接近 Opus 4.8 和 GPT-5.5,但仍落后于 Fable 5 与 GPT-5.6。关于价格,@kimmonismus 转述称其定价接近 Sonnet 5。另有帖子称模型 weights 将于 27 日发布,但本簇未见对应官方原帖确认该日期。

体验与分歧

@emollick 试用后认为,Kimi K3 已经相当强,在他的工作负载里很像“真正的大模型”;但他也指出,模型或其执行框架在处理任务时容易反复回到前面步骤,不断修改,尤其高强度模式下更明显。@mitsuhiko 的判断也偏正面,认为它把开权重模型往前推了一大截,视觉表现尤其不错,日常使用时常常已接近 SOTA 体验。相比之下,Bindu Reddy 更谨慎:他认为 K3 确实缩小了差距,但在自家包含隐藏题的 LiveBench 上,仍落后于最前沿闭源模型。

影响与待观察

包括 @emollick、@ideaofsoul 在内的多位发帖者都把 K3 看作格局变化信号,认为开权重模型不再只是追赶者。不过,本簇形成的共识仍然偏审慎:亮眼的公开成绩基本成立,但它能否真正改变头部竞争,还要看真实任务稳定性、agent 表现,以及更高成本是否能被接受。

2026-07-15 ~ 2026-07-17 · 184 条相关

事件全程(共 18 集)→

一手来源

另有 2 条近重复转述:kimmonismus · 1littlecoder