Engy 公布推理价格,Qwen3.6 缓存输入远低于 GLM-5.2
markjeffrey · x · 2026-07-22
Engy 放出了自己的推理计费页,直接展示按 token 计费的实时价格,以及命中 prompt cache 后的更低费用。
图里 glm-5.2 的价格是 输入 $0.68 / 百万 token、输出 $1.50 / 百万 token;qwen3.6-35b-a3b 则是 输入 $0.045、输出 $0.30,缓存输入只要 $0.015。页面还说明:prompt cache 命中会自动按缓存费率计费,而且 coding assistant、multi-turn tools 这类 agentic workload 往往能在重复前缀上拿到 90%+ 的缓存命中,所以真实有效成本通常远低于标价。
「Infra」频道最新
- QuixiAI 展示同一运行时覆盖 CUDA 到 CPU 六类后端 — QuixiAI · 2026-07-22
- Meta 基础设施被指为局部最优浪费芯片,代价上十亿美元 — dylan522p · 2026-07-22
- AMD 预告明日 AI 主题发布会 — xiaosun86 · 2026-07-22
- Azure 架构图工具加入 MCP,支持 Agent 生成 Bicep — davemccollough · 2026-07-22
- 本地加云端推理像汽车的 65 英里巡航 — dmitry140 · 2026-07-22
- Alphabet 资本开支电话会,关键看钱买了什么 — tengyanAI · 2026-07-22