Z.ai 推出 GLM-5.3-Flash:320B 参数、支持百万上下文与 NVFP4 量化
alejandroll10 · x · 2026-09-01
Z.ai 发布了 GLM-5.3-Flash 模型,采用混合稀疏与线性注意力架构,拥有 320B 总参数(18B 激活参数)和 100 万 token 上下文窗口,支持文本、图像和视频输入。该模型针对高效编码和长周期 Agent 任务设计,目前已通过 OrcaRouter 提供 API,输入定价为 $0.075/1M tokens,输出为 $0.25/1M tokens。此外,OrcaRouter 还发布了 GLM-5.3-Flash-Uncensored-NVFP4 版本,去除了内容审查并使用原生 NVFP4 量化以优化 GPU 推理性能。
「模型」频道最新
- 关注具体场景而非最强模型,选型逻辑正在变化 — aftahi_ai · 2026-09-01
- 用户吐槽 GPT-5.6 代码与幻觉问题,寄望 GPT-6 改善 — Prestigiouspite · 2026-09-01
- 传 GPT-6 已近人类计算机操控水平 — jYtanYj · 2026-09-01
- 开源模型转向非商用许可,后训练授权或成千亿市场 — zephyr_z9 · 2026-09-01
- Hailuo H3 Max 速度够快,用户用它做出了可交互 AI 开放世界 RPG — mtizard · 2026-09-01
- 九月或迎最大模型发布潮,Anthropic、OpenAI 新品在即 — ChrisUniverse · 2026-09-01