Z.ai 推出 GLM-5.3-Flash:320B 参数、支持百万上下文与 NVFP4 量化

alejandroll10 · x · 2026-09-01

Z.ai 发布了 GLM-5.3-Flash 模型,采用混合稀疏与线性注意力架构,拥有 320B 总参数(18B 激活参数)和 100 万 token 上下文窗口,支持文本、图像和视频输入。该模型针对高效编码和长周期 Agent 任务设计,目前已通过 OrcaRouter 提供 API,输入定价为 $0.075/1M tokens,输出为 $0.25/1M tokens。此外,OrcaRouter 还发布了 GLM-5.3-Flash-Uncensored-NVFP4 版本,去除了内容审查并使用原生 NVFP4 量化以优化 GPU 推理性能。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →