GLM 5.3 Flash 上线 RunInfra:254 tok/s、百万 token 上下文
alejandroll10 · x · 2026-08-27
推理服务商 RunInfra 第一天上线 GLM 5.3 Flash(zai-org 官方 FP8 版),主打速度、价格与缓存:
- 输出 254.1 tok/s,首 token 703ms;1M token 上下文
- 定价:输入 $0.10/1M、输出 $0.40/1M,缓存输入仅 $0.01/1M,官方实测缓存命中率 86%92%,重复前缀几乎免费
- OpenAI 兼容 API,改 base URL 即可接入;支持工具调用、JSON 模式、流式
- 零数据留存:不存储 prompt、不用于训练
「Infra」频道最新
- 预测:单台桌面机将能运行 k3 级模型 — AaronBergman18 · 2026-08-27
- Anthropic 拟斥资 450 亿美元锁定 460MW 算力,GPU 均价曝光 — zephyr_z9 · 2026-08-27
- Kioxia 拟投资 1 万亿日元在岩手县建第三座晶圆厂 — zephyr_z9 · 2026-08-27
- DeepSeek-V4-Flash 推理提速至 51.5 tok/s — antirez · 2026-08-27
- Colibrì 引擎升级:支持 2.8T 参数模型,显存吞吐暴增 — solyarisoftware · 2026-08-27
- 黄仁勋:500 亿美元数据中心投资回本周期不到一年 — zephyr_z9 · 2026-08-27