GLM 5.3 Flash 重写内核上线 RunInfra:670 tok/s、缓存命中率 99.7%
ycombinator · x · 2026-10-01
RunInfra 宣布重写了 GLM 5.3 Flash 背后的推理内核,正式上线 major release,并在 Vercel AI Gateway 跑出 670 tok/s 的速度。
- 价格:输入 $0.11 / 1M tokens,输出 $0.45 / 1M tokens,缓存命中仅 $0.03 / 1M
- 上下文:1M token,FP8 vendor-native 版本
- 硬件:现已支持 AMD GPU,同一模型同一 API,扩了更多算力
- 缓存表现:过去 24 小时缓存命中率 99.7%,dashboard 可查每次命中/未命中日志
- 兼容性:同时提供 OpenAI 兼容 chat completions 和 Anthropic 兼容 /v1/messages 接口,支持图文输入、工具调用、JSON mode、流式输出
- 隐私:零数据保留,不用于训练
「Infra」频道最新
- DGX Spark 一周涨价 2000 美元还一机难求 — StartupTim · 2026-10-01
- YC 系 Magnitude 开源推理引擎:Metal 上解码比 llama.cpp 快至 2 倍 — petrusenko_max · 2026-10-01
- 中国实验室重金购买美国数据公司专家训练数据引争议 — BarnacleBasic1988 · 2026-10-01
- Andrew Chen:当年 2 万美元工作站消失了,如今 PC 加块 RTX 又贵回去 — andrewchen · 2026-10-01
- PyTorch 大会中国站:开源是 AI 硬件、模型与推理快速演进的关键协调机制 — PyTorch · 2026-10-01
- FastFlowLM 支持 AMD NPU 跑 Qwen 27B,解码速度仅 1 tps — TuskNaPrezydenta2020 · 2026-10-01