开源权重模型落后闭源仅 4 个月,适用边界在哪里

TechPreacher · x · 2026-10-02

作者结合自己用两节点 NVIDIA DGX Spark 集群运行 GLM-5.3-Flash 的实践,划定了开源权重模型的适用边界。

核心数据:Epoch AI 的 Capabilities Index 显示,自 2026 年 1 月以来最佳开源模型平均落后闭源前沿约 4 个月(8 个指数点,约等于 GPT-5 与 GPT-5.5 的差距)。GLM-5.3-Flash(Z.ai 8 月发布,MIT 许可,320B 总参/18B 激活,1M 上下文,支持图文视频输入)与 Claude Opus 4.8 的对比中,多项基准互有胜负(Terminal Bench 2.1:84.3 vs 85.0;DeepSWE v1.1:63.4 vs 58.0;NL2Repo:56.3 vs 69.7),但注意这是厂商自报数据,且 Opus 4.8 已非 Anthropic 最新。

结论:开源模型不是前沿模型的全面替代,但在三种场景下是正确选择——任务有边界且可验证、数据不能出内网、需要没人能重新定价/限流/下线的端点。正确的问题不是「哪个模型最好」,而是「这个任务哪个模型够用」。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →