中美前沿模型是否追平:争论再起

7月中旬,「中国 AI 模型是否已追上美国前沿」的争论再度升温。@scaling01 花两天写成长文,试图把中美差距、能力对比与判断依据一次讲清,而非简单站队;@kimmonismus 连发两帖,认为中文开放权重模型正快速逼近、甚至施压美国前沿实验室;@teortaxesTex 则从训练范式切入,解释为何美国算力指数级增长、差距却仍停在「几个月量级」。整体上,这簇呈现的是对「是否追平」的持续争议,而非统一结论。

各方判断

@scaling01 的长文围绕「是否追平」梳理证据与判断依据,配图「Frontier Trends」趋势线把 GPT-5.6 Sol、Kimi K3 等点位放入同一框架,以历时视角观察前沿进展。@kimmonismus 的立场更乐观,他认为 Qwen、Kimi、DeepSeek、Minimax、GLM 等中文开放权重模型近期进展明显,性能与价格差距都已显著缩小,甚至开始对美国前沿实验室形成压力;另一帖还点名 Qwen-3.8-Max、GPT-5.6 Sol、Fable 5 的传闻对比,称若这些表现属实,意味着差距在进一步收窄。

差距为何没拉开

@teortaxesTex 给出一种解释:尽管美国算力仍在指数级增长,中美前沿模型差距却似乎保持在「几个月量级」。他转述的观点是,2024 年以来用 RL 训练推理链条已成为新的 scaling 重点,尤其在数学、竞赛编程等可量化任务上效果突出,这可能改变单纯比拼算力扩张的比较方式。

方法学上的自我质疑

值得注意的是,@scaling01 自己也点出方法学上的张力:他承认 Artificial Intelligence Index 不适合直接衡量模型真实强度,但文章后段又用它来预测 Kimi-K3 的 ECI,因此认为这种做法本身有些自相矛盾——可见即便主张「系统性比较」的一方,在评估口径上也留有保留。

2026-07-18 ~ 2026-07-19 · 7 条相关

一手来源