YC新创Isoquant上线:GLM-5.3-Flash推理$0.07/M,首token仅452ms
ycombinator · x · 2026-09-25
Y Combinator 孵化的 Isoquant 推出 Inference Cloud,主打市场上最快最便宜的 GLM-5.3-Flash:输入 $0.07/M tokens、输出 $0.20/M、缓存输入仅 $0.014/M;P50 首 token 延迟 452ms、端到端 2.3 秒、吞吐 158.9 tok/s,自测对比中显著快于 Together、CoreWeave、Fireworks、Baseten 等主流推理商(官方口径)。
技术栈上从 GPU kernel、混合精度、投机解码到 KV cache 与负载均衡做了全链路优化,同时上线 Qwen3.6-27B。API 兼容 OpenAI/Anthropic SDK,支持流式、工具调用、结构化输出、图像输入与自动 prompt 缓存,宣称零数据留存。
「Infra」频道最新
- 《现代微处理器 90 分钟指南》:系统/性能工程师的速成经典 — blaizedsouza · 2026-09-25
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25
- 开源 Jev 玩法:SGLang Radix Cache 助 Qwen3.6-35B-A3B 一秒跑完 64 个决策 — multiply_matrix · 2026-09-25
- Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍 — multiply_matrix · 2026-09-25
- 高通骁龙峰会主打'手机是 AI 中枢',欲造安卓版苹果式跨设备体验 — BenBajarin · 2026-09-25
- 5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存 — nirurin · 2026-09-25