专题 · FULL STORY

Kimi K3:从预热到开权重实测的狂欢

七月前沿模型传闻不断,月之暗面 Kimi K3 脱颖而出。从初期预热到实测登顶前端代码榜,其开权重策略不仅展现了比肩顶级的实力,更引发了对中国大模型追赶速度与开源生态的激烈探讨。

2026-07-05 ~ 2026-07-18 · 20 集 · 454 条

第 1 集 · 传闻称Gemini 3.5能力接近GPT-5.5水平(2026-07-05,3 条)

近期AI社区传闻谷歌新款Gemini 3.5模型表现极其出色。拥有大量粉丝的AI博主bindureddy透露,该模型的能力可能已达到GPT-5.5或GPT-5.6的水平。同时Reddit网友也对其充满期待并猜测其延期原因。不过,目前这些消息均属未经官方证实的传闻与推测。

第 2 集 · 传闻称七月将迎来前沿AI模型密集发布(2026-07-06,5 条)

多方传闻汇总显示,七月 AI 行业将迎来密集的前沿模型发布。预计 GPT-5.6、Gemini 3.5 Pro、Grok 4.5 以及 DeepSeek 新版等将在短期内相继推出。业内人士认为,在“AI 构建 AI”的趋势下,模型迭代正显著加速,未来十天内或有多款重磅模型同台竞争。

第 3 集 · 多款重磅大模型版本近期密集发布(2026-07-08,3 条)

近期传闻显示,多家头部 AI 大模型将在本月迎来密集发布。预计动态包括:Grok 4.5 与 GPT 5.6 率先发布,Gemini 3.5 预计下周推出,DeepSeek V4 和 Fable 5.1 也将在本月稍晚时候上线。消息指出,Grok 4.5 的能力已接近 Opus 级别且更具价格优势,AI 领域即将进入高度活跃期。

第 4 集 · Gemini 3.5 Pro 多次传出延期与性能争议(2026-07-10,6 条)

近期关于 Google Gemini 3.5 Pro 延期发布的传闻密集出现,引发了 AI 社区的广泛关注。原本预计在近期发布的模型,目前据称已被推迟至本月底或更久,反映出 Google 在前沿大模型激烈竞争下面临的研发与发布压力。

延期原因与时间线

多位消息人士确认了延期的消息。@koltregaskes 指出,延期的原因是模型最新的 checkpoints 表现不如旧版本。@bindureddy 也透露,发布目标已延至本月底。关于具体的发布时间,传闻存在分歧:有说法称可能要等待几周甚至更久,甚至可能晚于竞品 Opus 5 和 GPT-6;而 @JOBhakdi 引用的泄露传闻则显示,其目标发布日可能是 7 月 17 日。

性能预期与各方反应

针对该模型的能力,社区态度呈现两极分化。一方面,@JOBhakdi 提到的基准泄露传闻显示,Gemini 3.5 Pro 在内部评测中有望超越 Claude Fable 5 和 GPT-5.6,且零样本能力有显著提升。另一方面,部分用户持怀疑态度。@Angaisb_ 坦言即使模型最终发布,预计也会让人失望;@Rare_Bunch4348 更是调侃按此节奏,它可能会落后于其他竞品的发布周期。不过,@haider1 认为,为了确保模型在真实场景中的稳定性和高性能,等待是值得的,不应在未完全优化前仓促发布。

第 5 集 · AI基建牛市逻辑:开源模型或压缩前沿实验室利润(2026-07-13,3 条)

近期讨论指出 AI 基础设施可能迎来牛市。当前前沿实验室在推理端维持超70%毛利,但若市场份额转向更便宜的开源模型,基础设施层将因“每美元智能”提升而大幅受益。然而,AI 交易面临两难:闭源模型主导会推高算力成本,开源模型普及虽利好基建,却会压缩推理端的高毛利空间。

第 6 集 · AI效率提升反将放大需求(2026-07-13,2 条)

近期观点指出,AI效率的提升可能引发“杰文斯悖论”,即资源利用效率提高反而会增加总消耗。正如蒸汽机效率提升未减少煤炭使用,互联网变快催生了流媒体等新场景,AI智能变便宜也将扩大基础设施需求,而非缩减。这一悖论引发对AI工具是否会将世界消耗推得更大的反思。

第 7 集 · 传 Gemini 3.5 Pro 近期发布(2026-07-14,3 条)

多则传闻称,Google 原计划 6 月推出的 Gemini 3.5 Pro 已延期至 7 月,近期或在两周内亮相,甚至有说法指向 7 月 17 日。与此同时,Google AI Studio 也出现疑似相关模型提示,但官方尚未确认发布时间。

第 8 集 · Kimi K3 预热升温,KIVINE 现身 Arena(2026-07-14,43 条)

7 月中旬,月之暗面新模型 Kimi K3 的讨论迅速升温:一方面,Kimi 官方已开始预告,Arena 上也出现了可测试的“KIVINE”;另一方面,外界最关心的参数规模、上下文长度与最终能力,仍大多来自泄露和抢先实测。这让 K3 进入了“发布前夜”式高关注状态,但确定信息与传闻之间的边界依然很重要。

已知进展

据 testingcatalog,Kimi 官方账号已经开始为 K3 预热,至少可以确认新品在路上。@arena 随后表示,Kimi K3 的预览版已以 KIVINE 名义上线测试,并称正式发布即将到来。另有 Kimi 相关账号称,K3 可能在 7 月 15 日前后发布,并配套 7 月 15 日至 8 月 11 日的充值活动:单笔充值额外赠送 10%–30% credits,5000 元及以上赠送 30%。

泄露规格与传闻

Scobleizer 转述称,Moonshot 疑似误发后删除了一页“K3 launch”页面,外界据此猜测 K3 可能是 2.5 万亿参数、100 万上下文,并采用开源或 open-weight 方式。zephyr_z9 结合 FT 口径和外部爆料,称 K3 可能在当晚揭晓,规模或在 2–3 万亿之间。与此同时,zephyr_z9 也提醒,2.5T 的说法早在 4 月就曾由中文科技媒体快科技提过,而其可信度在中文用户中存在争议,因此这部分信息仍需谨慎看待。

抢先测试与分歧

多条帖子把 Arena 上的 KIVINE 视作 K3 早期版本。testingcatalog、arena 及其他转述中的小样本测试普遍认为,它在生成和代码任务上表现很强;有评价称其常常接近 Fable,整体稳定优于“5.6”,在部分代码场景里甚至能和 Fable 正面对比。basedjensen 转发的一项 Flappy Bird 测试还认为它明显强于 Opus-4.8。不过,早期口碑并非一边倒:teortaxesTex 转述的另一种看法认为,K3 更擅长前端任务,后端偏弱,目前仍明显不如 GLM-5.2。综合来看,K3 的热度已经拉满,但关键结论仍要等官方正式发布后才能坐实。

还有 23 条相关讨论 →

第 9 集 · Gemini 3.5 Pro 再延期传闻升温(2026-07-15,7 条)

7 月中旬,多条帖子集中传播 Google 再次推迟 Gemini 3.5 Pro 的说法,但帖内都没有给出 Google 的正式发布说明或其他可独立核验的证据。之所以引发关注,不只是因为“又延期”,还因为不少转述把原因指向模型表现未达内部要求,同时社区对 Google 迟迟不官宣、页面却反复刷新的做法明显不满。

传闻中的延期细节

较具体的一种说法称,Gemini 3.5 Pro 原本计划在 7 月 17 日进入 GA,但随后被后移,甚至可能拖到 8 月。另一些帖子则概括为:Google 推迟发布,是因为相关技术表现没有达到内部目标。还有更细的爆料称,一个“几乎完成”的版本因数学推理、SVG 场景生成和图像质量存在缺口,被推倒重建。

路线猜测与延伸讨论

有视频帖在延期传闻之外进一步猜测,Google 可能会更早推出 Gemini 3.6 Flash,甚至不排除直接转向 Gemini 4 的命名路线。不过作者也说明,这类判断建立在未发布 checkpoint 的推测上,并非官方路线图。

社区反应与存疑

除延期本身外,讨论焦点还落在 Google 的发布方式上。有人讽刺官方像是在不断刷新或重新索引页面,让时间显示停留在“6 hours ago”,却始终没有真正上线 Gemini 3.5 Pro。就这组材料而言,能确认的只有“延期传闻持续发酵、官方仍未证实”;至于具体时间点和技术原因,仍属于爆料与转述层面的信息。

第 10 集 · 前沿 AI 模型发布潮即将爆发(2026-07-15,2 条)

AI 领域正迎来新一轮加速“发布季”。综合社区传闻与信息整理,多款前沿模型已落地或即将发布,包括带来突破性体验的 GPT-5.6、回归的 Fable 5、Meta 的 Spark 1 以及临近发布的 Gemini 3.5 Pro 等。业界正密切关注未来 1 至 2 周内可能密集爆发的模型更新动态。

第 11 集 · AI开源激辩:封闭能否换来安全(2026-07-15,10 条)

7月15日,多位作者围绕“AI模型是否应该开源”展开集中讨论。@besanushi以一个反事实问题切入:如果过去10年机器学习完全建立在闭源之上,行业生态是否会变得更糟。这场讨论迅速延伸至安全防御、学术研究依赖以及产业权力集中等核心层面。

开源与安全的辩证

@kuchaev认为,将前沿能力封闭在少数公司内部并不能天然带来安全。他承认坏人滥用的风险存在,但强调安全系统不应靠“隐藏原理”来构建。他以网络安全领域依赖开源和可审计体系为例,指出模型越开放,越容易接受外部审计与红队测试。他回顾GPT-2曾被认为“太危险不能发布”的历史,指出过度保守已被证伪,并认为禁止开源AI将是损害美国AI领导力的历史性错误。@besanushi也补充,真正懂AI安全并能构建护栏的人并不多,知识垄断本身就是一种安全隐患。

开放光谱与研究基石

在@kuchaev看来,开放并非API与完全公开的二元选择,而是一个光谱。他以Nemotron为例,说明开放权重、代码和数据对大学和小实验室更具研究与安全价值。@sytelus进一步指出,开放研究是闭源模型进步的核心引擎,过去十年的关键进展(如开放数据集、muP、推测解码和RLVR等)都建立在此之上。@besanushi强调,大量学术研究和中小公司的本地部署、低成本实验高度依赖开源模型,若关闭这条路径,将严重损害全球参与度与知识扩散。

警惕能力垄断与审查控制

多位作者对权力集中提出警告。@kuchaev指出,AI面临的最大风险是少数公司控制一切,进而导致能力裁剪和按国家审查。@besanushi也表示,算力和模型资源分配不均会影响全球AI参与度,尽管真正的参与式设计很难实现,但直接关上开源大门会损害AI带来的生产力增益。他们一致认为,比起担忧开源被滥用,更应警惕少数利益集团对AI能力与访问权的绝对垄断。

第 12 集 · 多家新模型发布传闻齐出,厂商均未官宣(2026-07-15,7 条)

7 月 15 日,一场围绕多家头部厂商新模型发布节奏的传闻在 AI 圈集中发酵。@bindureddy、@Teknium 等账号率先转出一份“即将发布”的名单,同时 @zephyr_z9 等人补充了关于 Kimi K3 与 DeepSeek 的性能传闻。话题迅速扩散,但由于均无厂商官宣,外界对具体版本、命名与时间线尚无统一确认。

传闻名单与性能说法

@bindureddy 与 @Teknium 都提到接下来会有一批开源或闭源模型发布,共同指向 Opus 5、Gemini 3.5 Pro、DeepSeek v4 和 Kimi 3,并补充 Gemini 3.5 Pro 的 checkpoints 据说更好。两人还都提到对 Fable 在近期的某种地位判断(原帖此处被截断,具体表述不详)。@bindureddy 另在回复中单独提到 DeepSeek v4 已出现在讨论中,且还有一个 GA(正式发布)版本在路上。

Kimi K3 与 DeepSeek 的时间线说法

@zephyr_z9 称听闻 Kimi K3 表现已接近 Fable,同时 DeepSeek V4.1 也有相关传闻,并认为这些时间线彼此吻合;他还将其与 Dario 此前“2 月发布后 6-12 个月会出现开源版本”的判断联系起来。@giffmana、@dejavucoder、@daniel_mac8 的回复基本延续同一轮讨论,转述了相同的 Kimi K3 与 DeepSeek V4.1 说法。

争议与存疑

这组信息几乎全部来自圈内传闻与预告式讨论,缺少厂商正式发布、明确版本说明或可核验的性能数据。Kimi 3/K3、DeepSeek v4/V4.1/GA 等提法在不同帖中并不完全一致,说明外界对命名、发布时间和能力水平都还没有统一确认。

第 13 集 · Kimi K3 上线冲榜,开权重逼近前沿(2026-07-15,184 条)

月之暗面的新模型 Kimi K3 在 7 月 16 日前后开始出现在网页端和 App 端,并迅速因参数规模、上下文长度和榜单表现引发集中讨论。多条帖子把它描述为一款拥有 2.8T 参数、1M 上下文、面向 coding、agentic tasks、长程推理与视觉理解的模型。之所以值得关注,不只因为分数高,还因为它被不少人视为开权重模型再次逼近前沿闭源模型的信号,同时也暴露出稳定性与成本的现实取舍。

已披露信息

根据帖子转述的页面信息,K3 主打代码、智能体、长上下文推理和视觉能力。Artificial Analysis 给出的 Intelligence Index 分数为 57;其官方帖还称,K3 相比 K2.6 提升 13 分,但成本约增加 3 倍。多条帖子据此解读其已跻身榜单前列,并超过 Claude Opus 4.8;同一轮讨论里,它也被描述为接近 Opus 4.8 和 GPT-5.5,但仍落后于 Fable 5 与 GPT-5.6。关于价格,@kimmonismus 转述称其定价接近 Sonnet 5。另有帖子称模型 weights 将于 27 日发布,但本簇未见对应官方原帖确认该日期。

体验与分歧

@emollick 试用后认为,Kimi K3 已经相当强,在他的工作负载里很像“真正的大模型”;但他也指出,模型或其执行框架在处理任务时容易反复回到前面步骤,不断修改,尤其高强度模式下更明显。@mitsuhiko 的判断也偏正面,认为它把开权重模型往前推了一大截,视觉表现尤其不错,日常使用时常常已接近 SOTA 体验。相比之下,Bindu Reddy 更谨慎:他认为 K3 确实缩小了差距,但在自家包含隐藏题的 LiveBench 上,仍落后于最前沿闭源模型。

影响与待观察

包括 @emollick、@ideaofsoul 在内的多位发帖者都把 K3 看作格局变化信号,认为开权重模型不再只是追赶者。不过,本簇形成的共识仍然偏审慎:亮眼的公开成绩基本成立,但它能否真正改变头部竞争,还要看真实任务稳定性、agent 表现,以及更高成本是否能被接受。

还有 164 条相关讨论 →

第 14 集 · Kimi K3 登顶前端代码榜引热议(2026-07-16,53 条)

7 月 17 日前后,Kimi K3 因前端编码相关榜单成绩在社交平台集中出圈。多条帖子转述称,它已登上 Frontend Code Arena 榜首;之所以特别受关注,不只是排名变化本身,还因为不少讨论把它视为开权重模型逼近、甚至压过部分前沿闭源模型的一个信号。

榜单结果

传播最广的信息是:Kimi K3 在 Frontend Code Arena 获得 1679 分,超过 Claude Fable 5,pairwise win rate 为 76%,即同题对比中约四分之三情况下被选为更优输出。多条帖子还强调,这相较 Kimi-k2.6 属于从第 18 名直接跃升到第 1 名的明显跨越。另有转述称,它在 7 个前端相关子领域里拿下了 6 个第一;也有帖子把这一结果概括为 Kimi K3 在 arena.ai 或 WebDev Arena 上领先 Claude Fable 与 GPT 5.6 sol。

社区实测与观感

除榜单外,开发者还贴出了一些直观对比。scaling01 认为,Kimi K3 在一个 SVG 测试里输出质量超过 Fable,整体更有“大模型味道”;另有转述提到,它在 shader 场景生成任务中的结果也不错。带参考图的前端动画测试、网页风格生成,以及可自动运行的复古游戏 HTML 任务中,也都有帖子把 Kimi K3 展示为效果更好或成本更低的选项。TansuYegen 用并排结果调侃它比 GPT-5.6 Sol 更有“质感”;vista8 则专门称赞它生成网页时的美感,以及按不同风格分别产出 HTML+CSS 的能力。

信息边界

不过,现有材料大多仍是榜单转述、截图或个人实测片段,完整测试方法、提示词细节和统一评测条件并未在这些帖子里充分展开。因此,诸如“更有质感”“更像玩具”之类的说法,更适合作为发帖者个人观感,而不宜直接当作严格基准结论。

还有 33 条相关讨论 →

第 15 集 · 大模型前沿优势窗口仅剩数月(2026-07-16,2 条)

随着中国AI模型快速追赶,业界对中美竞争格局展开热议。有观点指出,OpenAI和Anthropic等头部企业的前沿优势窗口可能仅剩4到6个月。面对高昂的训练成本与逐渐缩小的技术代差,OpenAI或将凭借极强的实用主义与大规模廉价推理的工程能力来适应日益激烈的竞争。

第 16 集 · Kimi K3 引爆中国前沿模型再评估(2026-07-16,94 条)

Moonshot AI 的 Kimi K3 发布后,很快被讨论成一个不止关乎单款模型性能的事件:它是否意味着“中国实验室默认明显落后”的叙事需要重写。围绕它的争论也迅速外溢到训练算力、模型成本,以及 AI 产业链谁会受益等更大问题上。

发布信息与能力焦点

经转述的发布信息称,Kimi K3 主打“Open Frontier Intelligence”,总参数规模为 2.8 万亿,原生多模态,支持 100 万 token 上下文。官方宣称它在长上下文推理、agentic coding 和工具使用上表现突出;另有帖子提到其 active parameters 约在 60B-65B 区间。多名作者尤其看好它在 agentic coding 场景中的表现,认为已接近最强公开模型一档。

评价分化

乐观一侧认为,K3 至少说明不能再默认中国模型天然落后一截;tszzl、kimmonismus 等人都把它视为中国模型逼近、甚至在部分能力上挑战顶级闭源模型的信号。但谨慎意见同样明显。Emmett Shear 经 Ethan Mollick 转述提醒,围绕 Kimi 的快速结论过度依赖已趋于饱和的 benchmark 和 ELO 分数,更该看真正困难的问题。Emad 也经 Mollick 转述称,Kimi 是很好的进步,但不是 DeepSeek R1 那种“意外跃迁”。另有作者反对“Moonshot 会在年底前全面超越 OpenAI 和 Anthropic”的判断,认为编码能力接近,不等于通用能力全面反超。

成本、算力与产业影响

另一条主线是:在 GPU 受限背景下,Moonshot 如何训练出这样的模型。帖子中出现的解释包括强化学习、架构和数据效率更强,在中国境外租用 GPU,或外界低估了其实投算力;也有人提出华为训练芯片追近、或获得 Blackwell 等猜测,但都未获证实。成本方面,zephyr_z9 与 a16z 转述的观点都指出,K3 不能只被理解为“更便宜”,因为和部分早期中国大模型相比它其实更贵。至于产业链,SemiAnalysis 等观点认为,K3 所用的 KDA/线性注意力虽然会降低 KV cache 需求,却未必利空 NVIDIA、HBM、DRAM 和网络;相反,效率提升可能通过“杰文斯悖论”带来更大规模部署,利好云服务、Token-as-a-Service 及 AI 基础设施供应商。

还有 74 条相关讨论 →

第 17 集 · Kimi K3 性能比肩顶级模型引发 AI 圈热议(2026-07-16,3 条)

Kimi K3 发布后,其出色的性能表现引发了 AI 社区的广泛讨论与调侃。该模型在部分对比中已能比肩甚至超越顶级模型,导致业界出现了一种“被新模型刺激到”的情绪。尽管实力强劲,但它的发布并未引发以往常见的恐慌叙事,反而引发了关于行业竞争与模型更新速度的新一轮激烈争论。

第 18 集 · Kimi K3 实战编码能力引发争论(2026-07-16,6 条)

Kimi K3 因榜单成绩和初测口碑迅速成为开发者讨论焦点。多条帖子都在追问同一个问题:它是否真的能把 benchmark 上的高分兑现到真实工程任务里,尤其是在复杂代码库、跨语言和长期协作场景中是否站得住脚。这一讨论之所以值得关注,在于社区对它的评价出现了明显分化:一边是“很强”的第一印象,另一边则是对“只会做漂亮 demo”的警惕。

初测亮点与被看好的场景

被 @Scobleizer 转发的一则初测评价认为,K3 在艺术表达和商业判断上都很有创意,个性化表现也优于 Opus 4.8,体验上接近早期 ChatGPT 的状态。@zephyr_z9 转发的使用感受则把 K3 的优势指向前端任务,称它在这类场景里足够惊艳,甚至改变了作者原本依赖 Fable 的习惯;同一则转发也补充认为,Fable 在“哲学类任务”上依旧最强,Sol 在结构化任务上仍不可替代。另据 @basedjensen 转述的实测印象,Kimi 在系统管理员任务上的表现也非常突出,可能已经达到 Fable、Sol 同级,甚至更好。

真实代码能力仍待验证

不过,质疑声同样集中。@superSmitty9999 发帖时就明确表示,虽然看到榜单把 K3 放在 Fable 5、Sol 5.6 附近,但自己对 benchmark 一直持保留态度,希望看到更多真实使用体验。@Crazyscientist1024 也把问题进一步具体化:K3 是否真的超过 5.5 和 Opus 4.8,在哪些代码库、编程语言和任务上更强,社区需要拿出亲身案例,而不是只看排行榜。

争议核心:擅长 UI,不等于擅长工程

当前最尖锐的质疑来自 @_arohan_ 转述的一种看法:K3 在 UI 类任务上的强势,可能与模型针对常见视觉编码测试做了优化有关。按照这一判断,做出漂亮的 HTML 页面或 demo 还不是真正难点,更关键的是进入真实代码库后,能否理解项目结构、沿着既有逻辑调试和修改代码。综合这组帖子,K3 已经拿到了不少高评价的早期反馈,但它是否能稳定超越 5.5、Opus 4.8 乃至与 Fable 5、Sol 5.6 比肩,社区仍在等待更多来自真实仓库和实际开发任务的证据。

第 19 集 · Kimi K3 开权重引爆开放模型争论(2026-07-17,15 条)

7 月中旬,Kimi K3 的开源/开权重动向在 AI 圈引发密集讨论。焦点很快从模型能否打榜、是否接近顶级编程模型,扩展到一个更大的问题:开放前沿模型会怎样改变安全、政策与部署基础设施格局。多位作者都把这次事件视作一个信号——先进能力正在更快地从少数闭源服务外溢到可下载、可微调、可私有部署的模型。

发布与能力信号

Zachary Lipton 提到,发布方在经历融资受挫、核心成员离职等波折后,没有继续依赖“刷榜式”传播,而是选择以 Apache 2.0 许可免费开放下载。另有转述称,Kimi-K3 在“接口开发”相关排行榜升至第 1,超过 Claude Fable 5,而上一版本还在第 18;同一转述还提到,权重计划在 7 月 27 日开源。alexcovo_eth 转述认为,Kimi K3 在开权重模型中已经非常强,一些基准上甚至超过 Mythos/Fable。Benjamin Warner 则提出更务实的检验标准:与其看口碑,不如看支持者是否真的会取消 Claude Code 订阅,转向基于 Kimi 的编程工作流。

安全与政策讨论

ctjlewis 转述称,相比去破解闭源模型,直接微调开权重模型更容易把它改造成恶意编码代理,因为权重可获得、可再训练、可私有部署。MickeySteamboat 转发的观点进一步认为,中文模型的网络攻击能力正在快速逼近,未来既然会更广泛地可下载、可使用,单纯限制模型扩散并不现实,更可行的方向是把网络防御升级为 AI 驱动。Jeremy Howard 与 Matthew Chang 转述的文章也都强调,如果前沿能力走向“充足而非稀缺”,许多建立在稀缺假设上的政策概念最多只能争取短暂缓冲。

开源不等于低门槛

flowersslop 连发两帖给“开源热”降温:开源不等于免费、无限额度、无审查,也不意味着普通电脑就能轻松本地运行。bookwormengr 认为,开放权重不会消灭 AI 资本开支,反而会重塑它——模型仍难部署、仍需要大量硬件,因此会催生新的推理与托管基础设施公司;他还观察到,Kimi K3 与 Thinking Machines Inkling 等开放模型在发布时都刻意淡化自身的网络攻击能力,以减少来自 AI 安全倡导者的阻力。与此同时,basedjensen、zephyr_z9 与 abhiadesai 更强调积极面:前沿开放模型能抬高全球智能获取的基线,但如果开放模型真的成为主流,也将需要一整套属于自己的算力栈。

第 20 集 · Kimi K3编码实测接近前沿但体验欠佳(2026-07-17,3 条)

在近期的8项编码任务实测中,Kimi K3与Opus 4.8、GPT-5.6等模型对比,在已完成的7个任务里有6个表现持平或更优,展现出接近前沿模型的实力。然而,开发者对其综合使用体验提出质疑,认为其交互难用,并感叹当前开权重模型普遍存在“被基准测试刷满”的嫌疑,实际表现往往不及闭源模型稳定。