专题 · FULL STORY

Kimi K3:从预热到开源震撼发布的五天

月之暗面Kimi K3从传闻现身Arena,到以2.8万亿参数开源震撼发布,不仅登顶多项代码与能力评测榜单,更以极低定价搅动全球前沿模型竞争格局。

2026-07-14 ~ 2026-07-20 · 18 集 · 433 条

第 1 集 · Kimi K3 预热升温,KIVINE 现身 Arena(2026-07-14,43 条)

7 月中旬,月之暗面新模型 Kimi K3 的讨论迅速升温:一方面,Kimi 官方已开始预告,Arena 上也出现了可测试的“KIVINE”;另一方面,外界最关心的参数规模、上下文长度与最终能力,仍大多来自泄露和抢先实测。这让 K3 进入了“发布前夜”式高关注状态,但确定信息与传闻之间的边界依然很重要。

已知进展

据 testingcatalog,Kimi 官方账号已经开始为 K3 预热,至少可以确认新品在路上。@arena 随后表示,Kimi K3 的预览版已以 KIVINE 名义上线测试,并称正式发布即将到来。另有 Kimi 相关账号称,K3 可能在 7 月 15 日前后发布,并配套 7 月 15 日至 8 月 11 日的充值活动:单笔充值额外赠送 10%–30% credits,5000 元及以上赠送 30%。

泄露规格与传闻

Scobleizer 转述称,Moonshot 疑似误发后删除了一页“K3 launch”页面,外界据此猜测 K3 可能是 2.5 万亿参数、100 万上下文,并采用开源或 open-weight 方式。zephyrz9 结合 FT 口径和外部爆料,称 K3 可能在当晚揭晓,规模或在 2–3 万亿之间。与此同时,zephyrz9 也提醒,2.5T 的说法早在 4 月就曾由中文科技媒体快科技提过,而其可信度在中文用户中存在争议,因此这部分信息仍需谨慎看待。

抢先测试与分歧

多条帖子把 Arena 上的 KIVINE 视作 K3 早期版本。testingcatalog、arena 及其他转述中的小样本测试普遍认为,它在生成和代码任务上表现很强;有评价称其常常接近 Fable,整体稳定优于“5.6”,在部分代码场景里甚至能和 Fable 正面对比。basedjensen 转发的一项 Flappy Bird 测试还认为它明显强于 Opus-4.8。不过,早期口碑并非一边倒:teortaxesTex 转述的另一种看法认为,K3 更擅长前端任务,后端偏弱,目前仍明显不如 GLM-5.2。综合来看,K3 的热度已经拉满,但关键结论仍要等官方正式发布后才能坐实。

还有 23 条相关讨论 →

第 2 集 · 多家新模型发布传闻齐出,厂商均未官宣(2026-07-15,7 条)

7 月 15 日,一场围绕多家头部厂商新模型发布节奏的传闻在 AI 圈集中发酵。@bindureddy、@Teknium 等账号率先转出一份“即将发布”的名单,同时 @zephyrz9 等人补充了关于 Kimi K3 与 DeepSeek 的性能传闻。话题迅速扩散,但由于均无厂商官宣,外界对具体版本、命名与时间线尚无统一确认。

传闻名单与性能说法

@bindureddy 与 @Teknium 都提到接下来会有一批开源或闭源模型发布,共同指向 Opus 5、Gemini 3.5 Pro、DeepSeek v4 和 Kimi 3,并补充 Gemini 3.5 Pro 的 checkpoints 据说更好。两人还都提到对 Fable 在近期的某种地位判断(原帖此处被截断,具体表述不详)。@bindureddy 另在回复中单独提到 DeepSeek v4 已出现在讨论中,且还有一个 GA(正式发布)版本在路上。

Kimi K3 与 DeepSeek 的时间线说法

@zephyrz9 称听闻 Kimi K3 表现已接近 Fable,同时 DeepSeek V4.1 也有相关传闻,并认为这些时间线彼此吻合;他还将其与 Dario 此前“2 月发布后 6-12 个月会出现开源版本”的判断联系起来。@giffmana、@dejavucoder、@danielmac8 的回复基本延续同一轮讨论,转述了相同的 Kimi K3 与 DeepSeek V4.1 说法。

争议与存疑

这组信息几乎全部来自圈内传闻与预告式讨论,缺少厂商正式发布、明确版本说明或可核验的性能数据。Kimi 3/K3、DeepSeek v4/V4.1/GA 等提法在不同帖中并不完全一致,说明外界对命名、发布时间和能力水平都还没有统一确认。

第 3 集 · Kimi K3 上线冲榜,开权重逼近前沿(2026-07-15,184 条)

月之暗面的新模型 Kimi K3 在 7 月 16 日前后开始出现在网页端和 App 端,并迅速因参数规模、上下文长度和榜单表现引发集中讨论。多条帖子把它描述为一款拥有 2.8T 参数、1M 上下文、面向 coding、agentic tasks、长程推理与视觉理解的模型。之所以值得关注,不只因为分数高,还因为它被不少人视为开权重模型再次逼近前沿闭源模型的信号,同时也暴露出稳定性与成本的现实取舍。

已披露信息

根据帖子转述的页面信息,K3 主打代码、智能体、长上下文推理和视觉能力。Artificial Analysis 给出的 Intelligence Index 分数为 57;其官方帖还称,K3 相比 K2.6 提升 13 分,但成本约增加 3 倍。多条帖子据此解读其已跻身榜单前列,并超过 Claude Opus 4.8;同一轮讨论里,它也被描述为接近 Opus 4.8 和 GPT-5.5,但仍落后于 Fable 5 与 GPT-5.6。关于价格,@kimmonismus 转述称其定价接近 Sonnet 5。另有帖子称模型 weights 将于 27 日发布,但本簇未见对应官方原帖确认该日期。

体验与分歧

@emollick 试用后认为,Kimi K3 已经相当强,在他的工作负载里很像“真正的大模型”;但他也指出,模型或其执行框架在处理任务时容易反复回到前面步骤,不断修改,尤其高强度模式下更明显。@mitsuhiko 的判断也偏正面,认为它把开权重模型往前推了一大截,视觉表现尤其不错,日常使用时常常已接近 SOTA 体验。相比之下,Bindu Reddy 更谨慎:他认为 K3 确实缩小了差距,但在自家包含隐藏题的 LiveBench 上,仍落后于最前沿闭源模型。

影响与待观察

包括 @emollick、@ideaofsoul 在内的多位发帖者都把 K3 看作格局变化信号,认为开权重模型不再只是追赶者。不过,本簇形成的共识仍然偏审慎:亮眼的公开成绩基本成立,但它能否真正改变头部竞争,还要看真实任务稳定性、agent 表现,以及更高成本是否能被接受。

还有 164 条相关讨论 →

第 4 集 · Kimi K3 登顶前端代码榜引热议(2026-07-16,53 条)

7 月 17 日前后,Kimi K3 因前端编码相关榜单成绩在社交平台集中出圈。多条帖子转述称,它已登上 Frontend Code Arena 榜首;之所以特别受关注,不只是排名变化本身,还因为不少讨论把它视为开权重模型逼近、甚至压过部分前沿闭源模型的一个信号。

榜单结果

传播最广的信息是:Kimi K3 在 Frontend Code Arena 获得 1679 分,超过 Claude Fable 5,pairwise win rate 为 76%,即同题对比中约四分之三情况下被选为更优输出。多条帖子还强调,这相较 Kimi-k2.6 属于从第 18 名直接跃升到第 1 名的明显跨越。另有转述称,它在 7 个前端相关子领域里拿下了 6 个第一;也有帖子把这一结果概括为 Kimi K3 在 arena.ai 或 WebDev Arena 上领先 Claude Fable 与 GPT 5.6 sol。

社区实测与观感

除榜单外,开发者还贴出了一些直观对比。scaling01 认为,Kimi K3 在一个 SVG 测试里输出质量超过 Fable,整体更有“大模型味道”;另有转述提到,它在 shader 场景生成任务中的结果也不错。带参考图的前端动画测试、网页风格生成,以及可自动运行的复古游戏 HTML 任务中,也都有帖子把 Kimi K3 展示为效果更好或成本更低的选项。TansuYegen 用并排结果调侃它比 GPT-5.6 Sol 更有“质感”;vista8 则专门称赞它生成网页时的美感,以及按不同风格分别产出 HTML+CSS 的能力。

信息边界

不过,现有材料大多仍是榜单转述、截图或个人实测片段,完整测试方法、提示词细节和统一评测条件并未在这些帖子里充分展开。因此,诸如“更有质感”“更像玩具”之类的说法,更适合作为发帖者个人观感,而不宜直接当作严格基准结论。

还有 33 条相关讨论 →

第 5 集 · Kimi K3 引爆中国前沿模型再评估(2026-07-16,94 条)

Moonshot AI 的 Kimi K3 发布后,很快被讨论成一个不止关乎单款模型性能的事件:它是否意味着“中国实验室默认明显落后”的叙事需要重写。围绕它的争论也迅速外溢到训练算力、模型成本,以及 AI 产业链谁会受益等更大问题上。

发布信息与能力焦点

经转述的发布信息称,Kimi K3 主打“Open Frontier Intelligence”,总参数规模为 2.8 万亿,原生多模态,支持 100 万 token 上下文。官方宣称它在长上下文推理、agentic coding 和工具使用上表现突出;另有帖子提到其 active parameters 约在 60B-65B 区间。多名作者尤其看好它在 agentic coding 场景中的表现,认为已接近最强公开模型一档。

评价分化

乐观一侧认为,K3 至少说明不能再默认中国模型天然落后一截;tszzl、kimmonismus 等人都把它视为中国模型逼近、甚至在部分能力上挑战顶级闭源模型的信号。但谨慎意见同样明显。Emmett Shear 经 Ethan Mollick 转述提醒,围绕 Kimi 的快速结论过度依赖已趋于饱和的 benchmark 和 ELO 分数,更该看真正困难的问题。Emad 也经 Mollick 转述称,Kimi 是很好的进步,但不是 DeepSeek R1 那种“意外跃迁”。另有作者反对“Moonshot 会在年底前全面超越 OpenAI 和 Anthropic”的判断,认为编码能力接近,不等于通用能力全面反超。

成本、算力与产业影响

另一条主线是:在 GPU 受限背景下,Moonshot 如何训练出这样的模型。帖子中出现的解释包括强化学习、架构和数据效率更强,在中国境外租用 GPU,或外界低估了其实投算力;也有人提出华为训练芯片追近、或获得 Blackwell 等猜测,但都未获证实。成本方面,zephyrz9 与 a16z 转述的观点都指出,K3 不能只被理解为“更便宜”,因为和部分早期中国大模型相比它其实更贵。至于产业链,SemiAnalysis 等观点认为,K3 所用的 KDA/线性注意力虽然会降低 KV cache 需求,却未必利空 NVIDIA、HBM、DRAM 和网络;相反,效率提升可能通过“杰文斯悖论”带来更大规模部署,利好云服务、Token-as-a-Service 及 AI 基础设施供应商。

还有 74 条相关讨论 →

第 6 集 · Kimi K3 性能比肩顶级模型引发 AI 圈热议(2026-07-16,3 条)

Kimi K3 发布后,其出色的性能表现引发了 AI 社区的广泛讨论与调侃。该模型在部分对比中已能比肩甚至超越顶级模型,导致业界出现了一种“被新模型刺激到”的情绪。尽管实力强劲,但它的发布并未引发以往常见的恐慌叙事,反而引发了关于行业竞争与模型更新速度的新一轮激烈争论。

第 7 集 · Kimi K3 实战编码能力引发争论(2026-07-16,6 条)

Kimi K3 因榜单成绩和初测口碑迅速成为开发者讨论焦点。多条帖子都在追问同一个问题:它是否真的能把 benchmark 上的高分兑现到真实工程任务里,尤其是在复杂代码库、跨语言和长期协作场景中是否站得住脚。这一讨论之所以值得关注,在于社区对它的评价出现了明显分化:一边是“很强”的第一印象,另一边则是对“只会做漂亮 demo”的警惕。

初测亮点与被看好的场景

被 @Scobleizer 转发的一则初测评价认为,K3 在艺术表达和商业判断上都很有创意,个性化表现也优于 Opus 4.8,体验上接近早期 ChatGPT 的状态。@zephyrz9 转发的使用感受则把 K3 的优势指向前端任务,称它在这类场景里足够惊艳,甚至改变了作者原本依赖 Fable 的习惯;同一则转发也补充认为,Fable 在“哲学类任务”上依旧最强,Sol 在结构化任务上仍不可替代。另据 @basedjensen 转述的实测印象,Kimi 在系统管理员任务上的表现也非常突出,可能已经达到 Fable、Sol 同级,甚至更好。

真实代码能力仍待验证

不过,质疑声同样集中。@superSmitty9999 发帖时就明确表示,虽然看到榜单把 K3 放在 Fable 5、Sol 5.6 附近,但自己对 benchmark 一直持保留态度,希望看到更多真实使用体验。@Crazyscientist1024 也把问题进一步具体化:K3 是否真的超过 5.5 和 Opus 4.8,在哪些代码库、编程语言和任务上更强,社区需要拿出亲身案例,而不是只看排行榜。

争议核心:擅长 UI,不等于擅长工程

当前最尖锐的质疑来自 @arohan 转述的一种看法:K3 在 UI 类任务上的强势,可能与模型针对常见视觉编码测试做了优化有关。按照这一判断,做出漂亮的 HTML 页面或 demo 还不是真正难点,更关键的是进入真实代码库后,能否理解项目结构、沿着既有逻辑调试和修改代码。综合这组帖子,K3 已经拿到了不少高评价的早期反馈,但它是否能稳定超越 5.5、Opus 4.8 乃至与 Fable 5、Sol 5.6 比肩,社区仍在等待更多来自真实仓库和实际开发任务的证据。

第 8 集 · Kimi K3编码实测接近前沿但体验欠佳(2026-07-17,3 条)

在近期的8项编码任务实测中,Kimi K3与Opus 4.8、GPT-5.6等模型对比,在已完成的7个任务里有6个表现持平或更优,展现出接近前沿模型的实力。然而,开发者对其综合使用体验提出质疑,认为其交互难用,并感叹当前开权重模型普遍存在“被基准测试刷满”的嫌疑,实际表现往往不及闭源模型稳定。

第 9 集 · 传闻Kimi K3模型权重将于7月27日开源(2026-07-17,3 条)

网传月之暗面的 Kimi K3 模型权重预计将于 7 月 27 日开源,但爆料者评估其概率仅为五五开。据悉,该模型规模约 2.8T,能力接近 5.6 Sol。若传闻属实,将在模型开放策略等维度产生重大连锁影响,但其庞大的参数量也意味着本地部署运行将面临极高门槛,甚至戏称需 2TB 显存才能满足需求。

第 10 集 · Moonshot自评K3体验仍落后竞品(2026-07-17,2 条)

Moonshot 在官方博客中对自家最新模型 K3 进行了客观评估。公司表示,尽管 K3 在整体竞争力上表现强劲,但在实际用户体验方面,与 Claude Fable 5 以及 GPT 5.6 Sol 等头部竞品相比仍存在一定差距。这表明 K3 尚未完全满足顶尖模型的高标准交互需求。

第 11 集 · Kimi K3搅动局,GPT-6或提前发布(2026-07-17,3 条)

随着Kimi K3的发布,前沿大模型的竞争节奏正被显著加快。多位业内人士预测,OpenAI的GPT-6可能会在近一个半月内提前推出,Anthropic的Opus 5及Fable 5.1也有望在近期面世。尽管观点认为Kimi K3整体表现优异但尚不足以直接撼动OpenAI的霸主地位,但其出现已成功打破原有排期,迫使美厂加速迭代。

第 12 集 · Kimi K3 上线第三方 API 并支持百万 Tokens(2026-07-17,2 条)

Moonshot 的新模型 Kimi K3 已在第三方平台 AI/ML API 正式上线,与 Claude Fable 5 同步可用。该平台提供统一的 OpenAI 兼容端点,用户只需一个 API 密钥即可调用两款模型。Kimi K3 支持高达 100 万 tokens 的上下文,主要面向游戏开发等复杂工作负载。

第 13 集 · Kimi K3 计算机操控能力上线云端抢先体验(2026-07-17,2 条)

在官方正式演示发布前,用户现已可在 Clanker Cloud 平台上免费抢先试用 Kimi K3 的核心功能。此次开放试用的重点并非模型的基础推理能力,而是聚焦于其备受瞩目的 computer use(计算机操控)与 automation(自动化)能力。这为开发者提供了一个在安全环境中提前体验和测试该模型实际操作表现的绝佳机会。

第 14 集 · Kimi K3 安全强势但可靠性受疑(2026-07-17,5 条)

围绕 Kimi K3 的最新实测反馈出现明显分化。一类帖子认为,它在安全基准和安全修复任务上表现非常强,甚至体现出接近 SOTA 的能力;另一类帖子则质疑它在更广泛知识工作中的可靠性,问题集中在幻觉、统计推理错误和置信度校准上。对考虑把模型用于企业场景或高风险流程的人来说,这种“执行强、但稳定性仍待验证”的组合值得特别关注。

安全任务表现突出

@cramforce 表示,他用 Kimi K3 跑某个安全基准时得到了 SOTA 级结果,并补充说,一些更强的“fable class”模型因为不愿意做安全相关工作,没有纳入这轮讨论;在他的测试里,Kimi K3 的召回率接近 Codex/GPT。

另据 @SumitGup 转发的说法,在处理一份软件安全问题报告时,Codex 和 Fable 因“cyber guardrails”没有把问题全部修完,而 Kimi K3 完成了全部修复。该帖据此判断,在安全与修复类任务中,限制更少、执行更直接的模型,可能会占到优势。

可靠性与校准争议

与上述正面反馈并行,@evilsocket 提到,有评论认为 Kimi K3 虽然纸面指标很强,但幻觉率达到 51%,高于 K2.6 系列的 39%。@iruletheworldmo 则转述 Emollick 的提醒称,Kimi K3 Max 在复杂统计审计中出现了多处错误,包括统计方法误用和部分内容处理不当;他进一步判断,K3 在设计类任务上或许还可以,但在更广泛的知识工作中仍然存疑。

@ruthstarkman 还提到另一类问题:Kimi K3 能识别风险点,但给出的置信度高于实际应有水平。这意味着它未必完全看不到问题,真正的风险在于“说得太笃定”。综合这些帖子,Kimi K3 目前更像是一款在某些安全执行任务上很亮眼、但在事实可靠性和自我校准方面仍需继续观察的模型。

第 15 集 · Kimi K3登顶表格评测,KernelBench早期表现亮眼(2026-07-17,4 条)

Kimi K3 在多项基准测试中展现出强劲实力。在 SpreadsheetBench 2 评测中,它成功超越 Claude Fable 5 登顶第一,展现出对金融、规划和运营等复杂电子表格工作流的出色处理能力。此外,在针对 kernel 任务的 KernelBench 测试中,获得早期访问权限的用户也对其表现给予了高度评价,称其在未看具体分数前就已留下深刻印象,整体编码与数据处理潜力备受关注。

第 16 集 · 社区热议 Kimi K3 本地部署的极高硬件门槛(2026-07-17,4 条)

随着 Kimi K3 参数量传闻的流出,社区开始热烈讨论其本地部署的极高门槛。有估算称,运行该模型可能需要 4 台 512GB M3 Ultra Mac Studio(总内存 2TB),或 10 张 GB300 显卡,硬件总成本高达 100 万美元且每月电费约 1 万美元。也有开发者计划尝试使用 4 台 H100 节点通过 RoCE 互联等超算方案来跑通模型。

第 17 集 · Kimi K3 登顶前端代码榜,编程能力逼近 Fable 5(2026-07-18,12 条)

7 月 18 日至 19 日,Moonshot 新模型 Kimi K3 的编程能力成为社区焦点。Arena 官方宣布 Kimi-K3 在 Frontend Code Arena 取得 1,679 分并升至榜首,使中国模型首次在该前端代码榜上领先美国;转述还称它同时拿下 WebDev 人类偏好榜第一。围绕 DeepSWE、Artificial Analysis 等评测的多篇分析随后展开,核心共识是:Kimi K3 的代码能力已逼近一线闭源模型,而价格约为三分之一。

关键成绩

除 Arena 榜单外,转推还称 Kimi K3 在更接近真实产品开发的终端、长程编码任务上超过 Claude Fable 5 等闭源模型。在 Artificial Analysis 的编程 Agent 指数中,它得分 57,与 GPT-5.6 Terra 等并列第五,领先 Opus 4.8。zephyrz9 转发的多采样对比显示,Kimi K3 的 pass@1 为 68.5,略低于 Fable 5 的 69.9,但 pass@2 提升至 82.0。

性价比与细分表现

rohanpaulai 引用对比图称,在 DeepSWE rollout 任务里按每 100 美元成本计算,Kimi 可完成 14.7 个任务,Fable 5 为 5.3。zhyncs42 转述称,Kimi K3 可把前沿模型推理成本降低约 3 倍,并于 7 月 27 日起在 Together Compute 原生提供。ZainHasan6 进一步拆到语言维度:Rust 任务上极其接近榜首 Fable 并超过 GPT 5.6 Sol,Go 任务上以 79 比 71 击败 Fable。

失败模式与一致性

ZainHasan6 给出逐任务一致性分析:Kimi K3 与 Fable 的相关系数达 0.72,为已见最高的跨厂商相似度;双方都通过 96 个任务,Kimi-only 5,Fable-only 15。他还对比了失败分布,认为两者"失败指纹"几乎一样,约 65% 属于 near miss,且更偏向保守失败而非幻觉式错误。整体来看,这一轮讨论把 Kimi K3 定位为编程场景里兼顾成绩与成本的新竞争者。

第 18 集 · Kimi K3开源发布:2.8万亿参数冲榜引发震动(2026-07-18,3 条)

月之暗面发布了拥有约2.8万亿参数的完全开源模型Kimi K3,在Artificial Analysis等前沿榜单上表现惊人。该模型凭借强大的能力与开源属性,采用速度极快,甚至引发了AI概念股票的大幅下跌。分析指出,Kimi K3的发布意义重大,不仅证明了中国在开源领域的快速进步,也凸显了算力仍是当前行业发展的核心瓶颈。