智谱 GLM-5.3-Flash 发布:国产芯承载 1M 上下文
智东西 · wechat · 2026-08-27
智谱 AI 正式认领此前爆火的“牛来模型”为 GLM-5.3-Flash (320B-A18B),这是一款原生多模态模型,支持图片、视频、文件和文本输入。
技术架构与算力:
- 混合注意力机制:采用稀疏注意力与线性注意力混合,显著降低长上下文计算成本。引入 IndexPool 压缩缓存向量。
- 国产芯片出海:模型由 10 万张国产芯片承载,实现了 1M 超长上下文推理及全球高并发负载,是国产芯片首次大规模集体出海。
性能与定价:
- 性能:在 AA 综合智能指数上与 Claude Opus 4.8 持平,编程能力在自研体感评估中与 Opus 4.8 相当。
- 价格:输入 0.8 元/百万 tokens,输出 2.8 元/百万 tokens。综合性价比极高,约为 GLM-5.3 的 1/10,Opus 4.8 的 1/40。
实测表现:
- 多模态:能准确识别试卷并答题、根据截图复刻网站、将 48 分钟演讲剪辑为金句合集。
- 编程与游戏:根据需求开发 3D 潜水游戏、根据视频复刻 2D MOBA 对战机制(如《王者荣耀》)、为开源项目设计皮肤插件。
- 办公:5 分半读完 58 页论文并提炼精华,基于图表生成分析 PPT,生成 36 页求职报告。
所属事件:智谱开源 GLM-5.3-Flash:320B 多模态、成本降九成(45 条相关)→
「模型」频道最新
- OpenRouter 榜单:真金白银的消耗数据优于自媒体吹嘘 — sujingshen · 2026-08-27
- OpenAI 高 Token 效率或源于训练预算感知 — teortaxesTex · 2026-08-27
- Qwen 3.8 用户体验提升:简单操作不再引发 Token 冗余焦虑 — infieldmitt · 2026-08-27
- GLM 5.3 Flash 跑分实测:双 DGX 达 881 tok/s — teortaxesTex · 2026-08-27
- 曝年底前推出类 Her 语音模式,或随 GPT-6 发布 — flowersslop · 2026-08-27
- GLM 5.3 Flash 上线 90% 折扣,输出生成单价低至 0.04 美元 — shensi · 2026-08-27