神秘模型 Ox Alpha 揭晓:智谱 GLM-5.3-Flash 跑在国产芯片上
神秘模型 Ox Alpha 的真实身份被揭开:它实为智谱的 GLM-5.3-Flash。Bindu Reddy 于 8 月 26 日率先发现这一对应关系,随后智谱方面确认,该模型完全运行在中国产 GPU 硬件上,并宣称实现每日处理 100 万亿 tokens 的调用量。这一事件因罕见的免费额度规模和国产算力底座的可能性而引发社区高度关注。
已确认
- Ox Alpha 实为智谱 GLM-5.3-Flash,由 Bindu Reddy 发现并由智谱方面确认。
- GLM-5.3-Flash 拥有 100 万上下文窗口。
- 智谱宣称该模型每日处理量高达 100 万亿(100T)tokens,并提供大规模免费额度。
- SemiAnalysis 爆料称,其每天 100T tokens 的处理量完全基于中国芯片服务,展示了国产算力底座的大规模调度能力。
- 据 Bindu Reddy 8 月 27 日的后续分析,该模型在 6 天内已免费处理 42 万亿 token,完全运行在国产芯片上;技术栈采用自研 SGLang 推理引擎及 Encode-Pr(前缀编码)等优化手段。
尚未确认
- 算力支持方存在争议:Bindu Reddy 推测 Nvidia 可能提供了算力支持,从而允许免费提供高达 100T tokens 的训练/调用资源,并称这是开源 AI 的“天才营销策略”;但 @AccBalanced 的分析指出算力支持方可能是华为而非 Nvidia。双方均为推测,尚无官方确认。
- 社区对免费额度具体规模及个人配额限制的讨论也停留在推断层面。
为什么重要
- 若 100T tokens/日的处理量确系国产芯片支撑,将是中国 AI 算力在超大规模推理调度上的一次公开展示;@pstAsiatech 特别强调这一数据出现在“历经 4 年的芯片限制”背景之后,象征意义更强。
- 大规模免费开放本身构成重要竞争信号:无论背后是 Nvidia 还是华为,都以极低成本向开发者开放顶级模型,可能重塑开源 AI 生态的格局。SGLang 推理引擎等自研优化也展示了中国团队在推理基础设施上的工程能力。
2026-08-26 ~ 2026-08-27 · 6 条相关
一手来源
- 智谱揭秘 Ox Alpha 即 GLM-5.3-Flash,国产 GPU 日处理 100 万亿 Token — pstAsiatech ·
- Nvidia 或提供算力支持 GLM 5.3 免费开放 — bindureddy ·
- 智谱 GLM 3.5 Flash 六天免费处理 42 万亿 token,全靠国产芯片 — bindureddy ·
- 【源头】Nvidia 或提供算力支持 GLM 5.3 免费开放 — bindureddy · 2026-08-26
- 智谱 GLM 免费送 100 万亿 Token,疑获英伟达算力支持 — bindureddy · 2026-08-26
- GLM-5.3-Flash 日处理 100T tokens,竟全靠国产芯片 — airesearch12 · 2026-08-26
- 爆料:GLM 5.3 Flash 百万亿Token背后,华为或是算力支持方 — AccBalanced · 2026-08-27
- 【源头】智谱揭秘 Ox Alpha 即 GLM-5.3-Flash,国产 GPU 日处理 100 万亿 Token — pstAsiatech · 2026-08-27
- 【源头】智谱 GLM 3.5 Flash 六天免费处理 42 万亿 token,全靠国产芯片 — bindureddy · 2026-08-27