评论者称其推理架构复杂到基础设施商难以复制,建议自建可抽成 10-20%
zephyr_z9 · x · 2026-09-10
有评论者讨论大规模部署(2000 块 GPU + 存储集群)的规划,称该厂商的推理架构过于复杂,其他 infra 提供商难以复制或匹敌其推理经济性。
原评论者认为:与其让别人模仿,不如自己做部署,甚至可以考虑从基础设施提供商处抽取 10%-20% 的分成。业内普遍承认,目前没有人在推理成本效率上能与之竞争。
「Infra」频道最新
- 5 小时被扣 8.2 万美元账单:Google Cloud 用户遭天价扣费 — Patient_Election2179 · 2026-09-10
- TRL 发布百万 token 长上下文训练指南,单节点训通 Qwen3-8B — QGallouedec · 2026-09-10
- 双 RTX Pro 6000 + Threadripper 9955W 本地跑大模型,配置求把关 — No_Run8812 · 2026-09-10
- 截图显示 V4 时代 KV cache 机制存在 72 小时限制 — zephyr_z9 · 2026-09-10
- DeepSeek 九个月将每 token KV 缓存体积压缩 54 倍 — zephyr_z9 · 2026-09-10
- vLLM 完整支持 DeepSeek-V4.1-Flash 新架构,含投机解码与 PD 分离 — vllm_project · 2026-09-10