.07/M,首… · AGI Hunt

YC新创Isoquant上线:GLM-5.3-Flash推理$0.07/M,首token仅452ms

ycombinator · x · 2026-09-25

Y Combinator 孵化的 Isoquant 推出 Inference Cloud,主打市场上最快最便宜的 GLM-5.3-Flash:输入 $0.07/M tokens、输出 $0.20/M、缓存输入仅 $0.014/M;P50 首 token 延迟 452ms、端到端 2.3 秒、吞吐 158.9 tok/s,自测对比中显著快于 Together、CoreWeave、Fireworks、Baseten 等主流推理商(官方口径)。

技术栈上从 GPU kernel、混合精度、投机解码到 KV cache 与负载均衡做了全链路优化,同时上线 Qwen3.6-27B。API 兼容 OpenAI/Anthropic SDK,支持流式、工具调用、结构化输出、图像输入与自动 prompt 缓存,宣称零数据留存。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →